跳到主内容
multimodalGoogle

Gemini 3.8 Flash / Flash Cyber

Google 2026 年 9 月 2 日发布的 Gemini 3.8 Flash 与安全特化版 Flash Cyber,官方称「迄今最强推理与编程模型」,促销价 $0.75/$3.75 与 3.7 Flash 持平,Flash Cyber 面向 Fairwind 计划受信防御方。

发布 2026-09-06更新 2026-09-06核实 2026-09-06

规格

厂商
Google
发布日期
2026/9/2
类型
multimodal
上下文窗口
1049K tokens
定价
$0.75 / $3.75(促销价至 2026-12-31,之后 $1.50/$7.50)/ 百万 token
API 兼容
google, vertex

基准测试

54.9%(3.7 Flash 为 53.6%)
HLE-Verified
59.0%(3.7 Flash 为 50.6%)
OSWorld-2.0
86.2%(C/C++ 漏洞发现)
CyberGym(Flash Cyber)
超 70%(3.7 Flash 为 58.9%)
真实漏洞发现·20 语言(Flash Cyber)
pass@1 47.2%,成本远低于同分段旗舰
CWE-Bench 补丁(Flash Cyber)

优势

  • Google 自评「迄今最强推理与编程模型」,六周内第三个 Flash 版本,同价提速不涨价
  • DeepSWE v1.1 上以零头成本超过多数更大旗舰,长程软件工程性价比突出
  • 金融(Vals Finance Agent V2)与法律(Harvey Legal Agent)专业领域基准领先
  • Flash Cyber 安全特化:CyberGym 86.2%、20 语言真实漏洞发现率超 70%,已实战护住 Chrome
  • 「更用力」设计 + 可调 effort 档位,性能与成本可按任务伸缩

不足

  • 「更用力」意味着更耗 token,效率优先场景官方建议继续用 3.7 Flash
  • Terminal-Bench 4.0 仅 19.1%(OpenAI 对比口径),硬核终端编码仍是短板
  • 促销价只锁到 2026-12-31,年度预算要按 $1.50/$7.50 算
  • Flash Cyber 仅面向 Fairwind 计划的受信防御方,普通开发者拿不到
  • 国内接入需走 AI Studio / Vertex AI 合规通道

适用场景

高并发 Agent 工作流与自动化流水线(成本敏感型)长程软件工程任务(DeepSWE 类)金融 / 法律等专业领域的多步分析与报告安全团队:漏洞挖掘、自动化补丁(Flash Cyber,需 Fairwind 资质)

概述

Gemini 3.8 Flash 是 Google 于 2026 年 9 月 2 日发布的 Flash 系新档,距 3.7 Flash(8-12)仅三周,是六周内第三个 Flash 版本。官方直接给它的定性是「迄今最强的推理与编程模型」——注意这个「最强」没有限定在 Flash 档内,而是在与更高价旗舰的对比里说话:同价不涨(促销价延续 $0.75/$3.75),软件工程、agentic 任务与专业领域多步推理全面超过 3.7 Flash。

同日发布的 Gemini 3.8 Flash Cyber 是安全特化版:漏洞检测与自动化补丁达到前沿水平,但只面向 Fairwind 计划(政府机构、关键基础设施运营方、软件维护者)的受信防御方开放——与同周 GPT-6 Astra 的「Critical 门控」一样,安全能力分级开放已成行业惯例。

技术底牌上,两个变体共享同一基础智能,靠长程 agentic 循环递归评估与自我精炼,而编程与推理的增益相当一部分来自网络安全领域的严苛训练——把最难的任务当训练场,再反哺通用能力,这是 Google 这代的明显打法。

核心能力

「更用力」的推理:性能换 token

3.8 Flash 的核心设计选择是 works harder:复杂任务上执行更多推理步骤、迭代调用工具,高 effort 档位可能消耗更多 token 换性能。官方为效率优先的场景留了后路——调低 effort 档,或继续用 3.7 Flash(官方明确 3.7 保留支持效率型负载)。

成果落在三个方向:

  • 长程软件工程:DeepSWE v1.1 上超过多数更大的旗舰模型,成本只是零头;
  • 专业领域自主性:金融(Vals Finance Agent V2)与法律(Harvey's Legal Agent Benchmark)两项专业基准超过 3.7 Flash 与其他前沿模型——这直接指向「合规、分析、报告」类企业工作流;
  • 综合推理:HLE-Verified 54.9%(3.7 为 53.6%,Claude Opus 5 为 54.4%),OSWorld-2.0 从 50.6% 升至 59.0%。

Flash Cyber:把「防御者优势」做成产品

安全侧的数字值得单独看:

场景成绩对照
CyberGym(C/C++ 漏洞发现)86.2%超过 3.5 Flash Cyber 及 Mythos 5、GPT-5.5-Cyber 等更大模型
20 语言真实代码库漏洞发现超 70%3.7 Flash 为 58.9%
CWE-Bench 自动补丁pass@1 47.2%与最强旗舰(47.8%)基本持平,成本显著更低

实战成绩单:Chrome 安全团队用它产出的正确补丁量是最佳商用模型的 2.6 倍;Wiz 内部渗透测试基准上召回率高出 7.5-9.7 个百分点、成本低 2.3-5.2 倍;Google 云漏洞研究团队用它不到 2 小时找到一个基础级关键漏洞(常规研究要数月)。官方明确把「修漏洞」优先于「利用漏洞」的攻击性能力。

全渠道铺开

开发者走 Google Antigravity、AI Studio、Gemini CLI、Android Studio;企业走 Gemini Enterprise;消费者侧 Google AI Pro / Ultra 订阅即在 Gemini App、搜索 AI Mode 与 Google Sheets 中可用。

API 调用示例

from google import genai

client = genai.Client(api_key="YOUR_API_KEY")
resp = client.models.generate_content(
    model="gemini-3.8-flash",
    contents="审计这段依赖清单,指出已知 CVE 并给出升级建议",
)
print(resp.text)

与同档模型怎么选

维度Gemini 3.8 FlashGPT-6 AstraClaude Fable 5.1GPT-5.6 Terra
输入/输出价(/1M)$0.75/$3.75(促销)$10/$50$10/$50$2.50/$15
长程 SWEDeepSWE 超多数旗舰)74.1%
终端编码Terminal-Bench 19.1%)57.9%55.8%
专业领域 Agent金融/法律基准领先)
多模态原生文本 + 图片文本 + 图片文本 + 图片
国内可用需合规通道需中转需中转需中转

决策参考:高并发 Agent 流水线、专业领域分析与报告,3.8 Flash 是当前成本性能比最激进的选项;硬核终端编码与 computer use 上 GPT-6 Astra / Claude Fable 5.1;安全团队有 Fairwind 资质则优先 Flash Cyber。

避坑清单

  • token 消耗会上升:「更用力」设计在高 effort 档更贵更慢,成本敏感流水线先测 effort 档位再全量切换。
  • 促销价 12-31 到期:年度成本预算按 $1.50/$7.50 计,别按促销价签年度合约。
  • 终端编码别硬上:Terminal-Bench 19.1% 说明命令行 Agent 场景仍不是它的主场。
  • Flash Cyber 拿不到就别等:只对 Fairwind 计划受信方开放,普通团队的安全需求用 3.8 Flash 标准版 + 自建工具链。

FAQ

Q: 3.8 Flash 和 3.7 Flash 怎么选? A: 要更强编程/推理与专业领域 Agent,直接 3.8;延迟与 token 成本极度敏感的效率型负载,官方明确 3.7 继续服务,不必强行升级。

Q: Flash Cyber 和 GPT-6 Astra 的安全能力有什么区别? A: 路线不同:Astra 是通用旗舰里安全能力首次触顶被门控(公开版裁剪、Daybreak 放行);Flash Cyber 是专门为防御方训练的特化模型(Fairwind 白名单)。防御方有资质优先 Cyber,通用安全评审用 Astra 标准版。

Q: 国内怎么用? A: 走 Google AI Studio / Vertex AI 合规通道,或 OpenRouter 中转。

延伸阅读

来源

本卡片由 AI 之家 编辑部根据公开资料整理,非厂商付费内容;定价与基准以 Google 官方页面为准,欢迎在 反馈邮箱 反馈更新。

相关对比