Gemini 3.8 Flash / Flash Cyber
Google 2026 年 9 月 2 日发布的 Gemini 3.8 Flash 与安全特化版 Flash Cyber,官方称「迄今最强推理与编程模型」,促销价 $0.75/$3.75 与 3.7 Flash 持平,Flash Cyber 面向 Fairwind 计划受信防御方。
发布 2026-09-06更新 2026-09-06核实 2026-09-06规格
- 厂商
- 发布日期
- 2026/9/2
- 类型
- multimodal
- 上下文窗口
- 1049K tokens
- 定价
- $0.75 / $3.75(促销价至 2026-12-31,之后 $1.50/$7.50)/ 百万 token
- API 兼容
- google, vertex
基准测试
优势
- •Google 自评「迄今最强推理与编程模型」,六周内第三个 Flash 版本,同价提速不涨价
- •DeepSWE v1.1 上以零头成本超过多数更大旗舰,长程软件工程性价比突出
- •金融(Vals Finance Agent V2)与法律(Harvey Legal Agent)专业领域基准领先
- •Flash Cyber 安全特化:CyberGym 86.2%、20 语言真实漏洞发现率超 70%,已实战护住 Chrome
- •「更用力」设计 + 可调 effort 档位,性能与成本可按任务伸缩
不足
- •「更用力」意味着更耗 token,效率优先场景官方建议继续用 3.7 Flash
- •Terminal-Bench 4.0 仅 19.1%(OpenAI 对比口径),硬核终端编码仍是短板
- •促销价只锁到 2026-12-31,年度预算要按 $1.50/$7.50 算
- •Flash Cyber 仅面向 Fairwind 计划的受信防御方,普通开发者拿不到
- •国内接入需走 AI Studio / Vertex AI 合规通道
适用场景
概述
Gemini 3.8 Flash 是 Google 于 2026 年 9 月 2 日发布的 Flash 系新档,距 3.7 Flash(8-12)仅三周,是六周内第三个 Flash 版本。官方直接给它的定性是「迄今最强的推理与编程模型」——注意这个「最强」没有限定在 Flash 档内,而是在与更高价旗舰的对比里说话:同价不涨(促销价延续 $0.75/$3.75),软件工程、agentic 任务与专业领域多步推理全面超过 3.7 Flash。
同日发布的 Gemini 3.8 Flash Cyber 是安全特化版:漏洞检测与自动化补丁达到前沿水平,但只面向 Fairwind 计划(政府机构、关键基础设施运营方、软件维护者)的受信防御方开放——与同周 GPT-6 Astra 的「Critical 门控」一样,安全能力分级开放已成行业惯例。
技术底牌上,两个变体共享同一基础智能,靠长程 agentic 循环递归评估与自我精炼,而编程与推理的增益相当一部分来自网络安全领域的严苛训练——把最难的任务当训练场,再反哺通用能力,这是 Google 这代的明显打法。
核心能力
「更用力」的推理:性能换 token
3.8 Flash 的核心设计选择是 works harder:复杂任务上执行更多推理步骤、迭代调用工具,高 effort 档位可能消耗更多 token 换性能。官方为效率优先的场景留了后路——调低 effort 档,或继续用 3.7 Flash(官方明确 3.7 保留支持效率型负载)。
成果落在三个方向:
- 长程软件工程:DeepSWE v1.1 上超过多数更大的旗舰模型,成本只是零头;
- 专业领域自主性:金融(Vals Finance Agent V2)与法律(Harvey's Legal Agent Benchmark)两项专业基准超过 3.7 Flash 与其他前沿模型——这直接指向「合规、分析、报告」类企业工作流;
- 综合推理:HLE-Verified 54.9%(3.7 为 53.6%,Claude Opus 5 为 54.4%),OSWorld-2.0 从 50.6% 升至 59.0%。
Flash Cyber:把「防御者优势」做成产品
安全侧的数字值得单独看:
| 场景 | 成绩 | 对照 |
|---|---|---|
| CyberGym(C/C++ 漏洞发现) | 86.2% | 超过 3.5 Flash Cyber 及 Mythos 5、GPT-5.5-Cyber 等更大模型 |
| 20 语言真实代码库漏洞发现 | 超 70% | 3.7 Flash 为 58.9% |
| CWE-Bench 自动补丁 | pass@1 47.2% | 与最强旗舰(47.8%)基本持平,成本显著更低 |
实战成绩单:Chrome 安全团队用它产出的正确补丁量是最佳商用模型的 2.6 倍;Wiz 内部渗透测试基准上召回率高出 7.5-9.7 个百分点、成本低 2.3-5.2 倍;Google 云漏洞研究团队用它不到 2 小时找到一个基础级关键漏洞(常规研究要数月)。官方明确把「修漏洞」优先于「利用漏洞」的攻击性能力。
全渠道铺开
开发者走 Google Antigravity、AI Studio、Gemini CLI、Android Studio;企业走 Gemini Enterprise;消费者侧 Google AI Pro / Ultra 订阅即在 Gemini App、搜索 AI Mode 与 Google Sheets 中可用。
API 调用示例
from google import genai
client = genai.Client(api_key="YOUR_API_KEY")
resp = client.models.generate_content(
model="gemini-3.8-flash",
contents="审计这段依赖清单,指出已知 CVE 并给出升级建议",
)
print(resp.text)
与同档模型怎么选
| 维度 | Gemini 3.8 Flash | GPT-6 Astra | Claude Fable 5.1 | GPT-5.6 Terra |
|---|---|---|---|---|
| 输入/输出价(/1M) | $0.75/$3.75(促销) | $10/$50 | $10/$50 | $2.50/$15 |
| 长程 SWE | DeepSWE 超多数旗舰) | 74.1% | ||
| 终端编码 | Terminal-Bench 19.1%) | 57.9% | 55.8% | |
| 专业领域 Agent | 金融/法律基准领先) | |||
| 多模态 | 原生 | 文本 + 图片 | 文本 + 图片 | 文本 + 图片 |
| 国内可用 | 需合规通道 | 需中转 | 需中转 | 需中转 |
决策参考:高并发 Agent 流水线、专业领域分析与报告,3.8 Flash 是当前成本性能比最激进的选项;硬核终端编码与 computer use 上 GPT-6 Astra / Claude Fable 5.1;安全团队有 Fairwind 资质则优先 Flash Cyber。
避坑清单
- token 消耗会上升:「更用力」设计在高 effort 档更贵更慢,成本敏感流水线先测 effort 档位再全量切换。
- 促销价 12-31 到期:年度成本预算按 $1.50/$7.50 计,别按促销价签年度合约。
- 终端编码别硬上:Terminal-Bench 19.1% 说明命令行 Agent 场景仍不是它的主场。
- Flash Cyber 拿不到就别等:只对 Fairwind 计划受信方开放,普通团队的安全需求用 3.8 Flash 标准版 + 自建工具链。
FAQ
Q: 3.8 Flash 和 3.7 Flash 怎么选? A: 要更强编程/推理与专业领域 Agent,直接 3.8;延迟与 token 成本极度敏感的效率型负载,官方明确 3.7 继续服务,不必强行升级。
Q: Flash Cyber 和 GPT-6 Astra 的安全能力有什么区别? A: 路线不同:Astra 是通用旗舰里安全能力首次触顶被门控(公开版裁剪、Daybreak 放行);Flash Cyber 是专门为防御方训练的特化模型(Fairwind 白名单)。防御方有资质优先 Cyber,通用安全评审用 Astra 标准版。
Q: 国内怎么用? A: 走 Google AI Studio / Vertex AI 合规通道,或 OpenRouter 中转。
延伸阅读
- 上代对照:Gemini 3.7 Flash / Gemini 3.6 Flash
- 同周对手:GPT-6 Astra / Claude Fable 5.1
- 配套工具:Google Antigravity / Gemini CLI
- 相关资讯:Gemini 3.7 Flash 发布 / 2026 年 9 月上旬 AI 动态盘点
来源
- Introducing Gemini 3.8 Flash and 3.8 Flash Cyber(Google 官方博客,2026-09-02)
- Gemini 3.8 Flash Model Card(Google DeepMind)
- Gemini 3.8 Flash is out with a new focus on cybersecurity(Android Authority)
本卡片由 AI 之家 编辑部根据公开资料整理,非厂商付费内容;定价与基准以 Google 官方页面为准,欢迎在 反馈邮箱 反馈更新。
Claude Code vs Gemini CLI:终端 AI Agent 怎么选?(2026 选型指南)
Claude Code 和 Gemini CLI 都是终端原生的 AI 编码 Agent。一句话结论 + 决策树 + 价格 + 国内可用性对比:长任务与 CLAUDE.md 生态选前者,免费额度与接入门槛选后者。
Codex CLI vs Gemini CLI:两家大厂终端 Agent 怎么选?(2026 选型)
OpenAI Codex CLI 与 Google Gemini CLI 的正面比较:一句话结论 + 决策树 + 价格 + 国内可用性。已有 ChatGPT 账号选 Codex,想零成本起步选 Gemini CLI。
OpenRouter vs LiteLLM:LLM API 网关怎么选?SaaS 聚合 vs 开源自托管
OpenRouter vs LiteLLM 2026 选型对比:从模型数量、自托管能力、fallback 策略、虚拟 Key、国内延迟、成本结构和适合人群判断,帮你决定用 SaaS 聚合 OpenRouter 还是用开源自托管 LiteLLM 做 LLM 网关。
OpenRouter vs One API:托管模型路由与自建网关怎么选(2026)
OpenRouter 是托管的模型路由服务,One API 是自建的 API 分发网关。一句话结论 + 决策树 + 成本对比:要零运维接入几百个模型选前者,要数据自控与团队分发选后者。