跳到主内容
multimodalGoogle

Gemini 3.7 Flash

Google 2026 年 8 月发布的 agent-first Flash 模型,发布价 $0.75/$3.75 每百万 token(约为 3.6 Flash 一半),1M 上下文,编程与 Agent 基准大幅跳升,驱动 Gemini Spark 常驻 Agent。

发布 2026-08-15更新 2026-08-15

规格

厂商
Google
发布日期
2026/8/12
类型
multimodal
上下文窗口
1049K tokens
最大输出
66K tokens
定价
$0.75 / $3.75(至 2026-12-31,之后 $1.50/$7.50)/ 百万 token
API 兼容
google, vertex

基准测试

43.6%(3.6 Flash 为 34.4%)
FrontierCode 1.1
65.3%(3.6 Flash 为 49.0%)
DeepSWE v1.1
30.4%(3.6 Flash 为 17.0%)
AutomationBench(Zapier 真实工作流)

优势

  • agent-first 定位:更 diligent 地思考、遇阻自适应、指令遵循更忠实
  • 发布价较 3.6 Flash 腰斩($0.75/$3.75),直冲「工作马」成本底线
  • 1M 上下文 + 原生多模态,长上下文 Agent 与多模态流水线友好
  • 编程/Agent 基准大幅跳升:FrontierCode 1.1、DeepSWE v1.1、AutomationBench 全线翻倍级提升
  • 驱动 Gemini Spark 24/7 常驻 Agent(AI Pro / Ultra 订阅)

不足

  • 促销价仅锁到 2026-12-31,年末会回到 $1.50/$7.50
  • 「minimal」思考档已移除,低延迟场景需显式控制思考预算
  • 编程绝对峰值仍低于 Sol / Opus,硬核编码先对照 GPT-5.6 / Claude
  • 国内直连需合规通道(AI Studio / Vertex AI)

适用场景

高并发 Agent 与自动化流水线(成本敏感)真实业务工作流自动化(Zapier AutomationBench 类任务)长上下文 RAG / 文档理解多模态内容生成与审核

概述

Gemini 3.7 Flash 是 Google 于 2026 年 8 月 12 日发布的 agent-first Flash 模型,距离 3.6 Flash(7-21)仅约三周。它把发布价直接打到 $0.75 输入 / $3.75 输出(每百万 token),约为 3.6 Flash 首发价的一半,且该促销价锁定至 2026-12-31,之后回到 $1.50/$7.50。

与 3.6 Flash「低价多模态工作马」的定位不同,3.7 Flash 的叙事是 agent-first:官方称它「思考更 diligent、遇阻会自适应调整、指令遵循更忠实」。配套基准全线跳升——FrontierCode 1.1 从 34.4% 升到 43.6%,DeepSWE v1.1 从 49.0% 升到 65.3%,Zapier 的 AutomationBench(真实业务工作流评测)从 17.0% 近乎翻倍到 30.4%。它同时驱动 Gemini Spark——面向 AI Pro / Ultra 订阅者的 24/7 常驻 Agent。

延伸:若你还在用 3.6 Flash,注意 3.7 Flash 是同档的显著升级而非微调。详见 Gemini 3.6 Flash

核心能力

agent-first:从「回答」到「干活」

3.7 Flash 的发布重点不是参数或上下文(仍是 1M 输入 / 65K 输出),而是在 Agent 环路里的可靠性

  • 更 diligent 的推理:遇阻时更倾向重新规划而非硬闯;
  • 指令遵循更忠实:长任务里更少「跑偏」或跳过验证步骤;
  • 自适应调整:中途出现新信息(如工具返回异常)时能修正原计划。

这直接反映在工作流基准上——AutomationBench 衡量的是「在真实 SaaS 工具链里完成多步业务任务」,3.7 Flash 从 17.0% 跳到 30.4%,意味着它真正能跑通的真实业务流程比例接近翻倍。

价格腰斩重塑「工作马」档

档位输入输出备注
Gemini 3.7 Flash(促销期)$0.75 / 1M$3.75 / 1M锁至 2026-12-31
Gemini 3.7 Flash(促销后)$1.50 / 1M$7.50 / 1M2027 起
Gemini 3.6 Flash$1.50 / 1M$7.50 / 1M上一代

对 Agent 舰队而言,这意味着「工作马」档本身的成本包络被重写——高频、多步、长上下文的自动化任务现在能用更低的单价跑。

驱动 Gemini Spark 常驻 Agent

3.7 Flash 是 Gemini Spark 的底座——Google 面向 AI Pro / Ultra 订阅者提供的 24/7 常驻 Agent,可跨连接的应用与文件持续推进项目。这是 Google 把「模型 → Agent 产品」链路打通的标志。

工具与运行变化

  • 「minimal」思考档已移除:低延迟场景需显式设思考预算,否则默认更「用力」;
  • 服务端工具:可通过 llm -m gemini-3.7-flash -T CodeExecution 启用服务器端代码执行等工具(Simon Willison 的 llm-gemini 0.33 已支持);
  • 原生函数调用、结构化输出、流式均保留。

API 调用示例

from google import genai

client = genai.Client(api_key="YOUR_API_KEY")
resp = client.models.generate_content(
    model="gemini-3.7-flash",
    contents="把这份表单数据按字段校验并输出结构化 JSON",
)
print(resp.text)

与同档模型怎么选

维度Gemini 3.7 FlashGPT-5.6 TerraClaude Sonnet 5DeepSeek V4-Flash
输入价(/1M)$0.75(促销)$2.50$2(促销)$0.14
Agent/工作流AutomationBench 30.4%)
多模态原生全模态reasoning + vision图片有限
上下文1M1.1M1M1M
国内可用需合规通道需中转需中转直供

决策树

  • 多模态 + 长上下文 + 低成本高并发 Agent → 3.7 Flash(促销期内性价比极高);
  • 硬核编程 Agent / 终端自动化 → 优先 GPT-5.6Claude Sonnet 5
  • 极致便宜的超大规模跑量DeepSeek V4-Flash

避坑清单

  • 促销价有期限:$0.75/$3.75 仅到 2026-12-31,做年度成本预算要按 $1.50/$7.50 算。
  • 「minimal」档没了:依赖低思考延迟的场景需显式控制推理预算,否则默认更慢更贵。
  • 别当编程绝对主力:AutomationBench 提升明显,但 Terminal-Bench / SWE-bench 类硬核编码仍以 Sol/Opus 为标杆,先用公开基准比对。
  • 国内接入:走 Google AI Studio / Vertex AI,需合规通道。

FAQ

Q: 3.7 Flash 和 3.6 Flash 怎么选? A: 直接用 3.7 Flash。同价(促销期还更便宜)且 Agent/编程基准大幅领先,几乎没有理由留在本代。

Q: 促销结束后会变贵吗? A: 会回到 $1.50/$7.50(与 3.6 Flash 同价)。若你的体量很大,建议在大促结束前评估锁定或路由到 DeepSeek V4-Flash

Q: 能替代编程 Agent 吗? A: 工作流类(AutomationBench +30%)够用,但纯 SWE-bench / Terminal-Bench 硬核编码仍建议 GPT-5.6 / Claude 兜底。

延伸阅读

相关工具

相关对比

Augment Code vs Cursor:企业 AI 编程怎么选?Context Engine vs AI IDE 对比

Augment Code vs Cursor 2026 选型对比:Context Engine 全仓索引的企业 AI 平台 vs SpaceX 收购的 AI IDE 天花板,从形态、Context 覆盖、长任务、价格、合规、中文支持和适合人群 8 个维度判断,帮你选对企业 AI 编程工具。

Cursor vs Aider:GUI IDE 还是 CLI?2026 对比

Cursor vs Aider 2026 选型对比:GUI IDE vs Git 原生 CLI,从 Composer vs Architect 双模型、Tab 补全、多模型 BYOK、价格计费、开源与否和适合人群判断,帮开发者选对。Cursor 是闭源 VS Code fork 月费 $20,Aider 是开源 Apache-2.0 CLI 自带 API key。

Cursor vs Claude Code:什么时候用哪个?(2026 实测选型)

Cursor 和 Claude Code 到底怎么选?一句话结论 + 决策树 + 价格实测 + 国内可用性对比。GUI 派选 Cursor,终端长任务派选 Claude Code,最优解其实是共存。

Cursor vs GitHub Copilot:AI IDE 还是插件?2026 对比

Cursor vs GitHub Copilot 2026 选型对比:AI 原生 IDE vs IDE 插件,从 Composer vs Agent Mode、Tab 补全、多模型、AI Credits 计费、企业版和适合人群判断,帮开发者选对。Cursor 是 VS Code fork 重写交互层,Copilot 是 VS Code 插件继承原生体验。两家都已切 usage 制。

Cursor vs Trae:国内开发者怎么选?价格、模型、网络和真实体验对比

Cursor vs Trae 2026 选型对比:从价格、模型能力、国内访问、Builder/Composer、多文件改写、MCP 生态和适合人群判断,帮国内开发者决定继续用 Cursor,还是切到字节 Trae。

Cursor vs v0:AI 编程 IDE vs AI 前端生成器怎么选?

Cursor vs v0 2026 选型对比:Anysphere 的 AI 原生 IDE vs Vercel 的 AI 前端组件生成器。从定位、工作流、输出物、价格、适合人群 6 个维度帮你选对工具:全栈工程选 Cursor,快速 UI 原型选 v0。