跳到主内容
multimodalGoogle

Gemini 3.6 Flash

Google 于 2026 年 7 月 21 日发布的稳定版 Flash 模型,1M 上下文、65K 输出,定价 $1.50/$7.50 每百万 token,定位高吞吐多模态场景,原生支持函数调用与流式。

发布 2026-07-27更新 2026-08-15

规格

厂商
Google
发布日期
2026/7/21
类型
multimodal
上下文窗口
1049K tokens
最大输出
66K tokens
定价
$1.50 / $7.50(cache $0.15)/ 百万 token
API 兼容
google, vertex

优势

  • 原生多模态:文本 / 图像 / 视频 / 音频统一输入,响应快
  • 1M 输入上下文 + 65K 输出,长文档与代码库友好
  • Flash 定位低价低延迟,适合高吞吐自动化与 Agent
  • Google AI Studio / Vertex AI 全托管,接入简单
  • 原生函数调用、结构化输出与流式,工程接入成本低

不足

  • 独立于编程(SWE-bench / Terminal-Bench 等)基准未随发布公布,编程 Agent 场景仍以 GPT-5.6 / Claude 为主流参照
  • 输入缓存需命中才享 $0.15,短请求收益有限
  • 国内直连需合规通道(AI Studio / Vertex AI)

适用场景

高并发多模态内容生成与审核长上下文 RAG / 文档理解低成本 Agent 与自动化流水线实时翻译、摘要、客服对话

概述

Gemini 3.6 Flash 是 Google 于 2026 年 7 月 21 日在 Gemini API 上线的稳定版(stable) Flash 模型。它延续 Flash 系列的「低价、低延迟、原生多模态」定位,提供 1,048,576 token 输入上下文65,536 token 输出上限,官方定价 $1.50 输入 / $7.50 输出 / $0.15 缓存输入(每百万 token)。

2026-08 更新:同档已发布 Gemini 3.7 Flash——发布价腰斩($0.75/$3.75,锁至 2026-12-31)、agent-first 定位、AutomationBench 等基准翻倍。新项目建议直接用 3.7 Flash,本代仅作存量参考。

在 Gemini 的产品阶梯里,3.6 Flash 处在「性价比中枢」:

  • Gemini 3 Pro / 3.5 Pro:能力天花板,贵,适合最难的任务;
  • Gemini 3.6 Flash(本文):能力够用、便宜、快,绝大多数生产场景的默认档;
  • Gemini 3.5 Flash-Lite(同批上线,$0.30/$2.50):极致成本,适合超大规模、对质量容忍度高的自动化。

同批上线的还有 Gemini 3.5 Flash-Lite(7 月 21 日,定位超大规模自动化,$0.30/$2.50 输入/输出)。「stable」意味着它不再是预览/实验通道,SLA、版本稳定性与定价都进入长期维护状态——这对生产接入很关键。

核心能力

原生多模态:一次输入,多种信号

Gemini 3.6 Flash 的图像、视频、音频与文本是统一模态(native multimodal),不需要像很多模型那样先把图片转成独立视觉 token 或走单独的视觉子模型。带来的直接好处:

  • 一条请求里可以同时塞「一段产品演示视频 + 几张截图 + 一段用户语音 + 文字指令」,模型一并理解;
  • 适合「感知型」工作流:内容审核、视频摘要、带图客服、多模态 RAG。

对比:不少模型对图片是「附加上下文」,Gemini 的强项是把视频/音频也当成一等公民。如果你的场景只是「看图回答问题」,差异不明显;但若涉及视频时序理解音视频联合推理,Flash 的多模态原生度更有体感。

长上下文工程实践

1M 输入上下文意味着你可以把一整本书、一份几百页 PDF、或一个中型代码仓库直接放进一次请求。但实际落地有讲究:

  • 不要无脑塞满:超长上下文单次成本更高,且模型对「中间段」信息的注意力会衰减(lost-in-the-middle)。优先放与当前任务最相关的片段。
  • 长文档 RAG 的新玩法:对 1M 上下文,很多场景可以从「切块召回」退化为「整文档直读」,省掉向量库与召回链路,但要在成本与延迟间权衡。
  • 代码库问答:把 README + 关键模块 + 报错栈一起喂进去,比只贴报错栈有效得多。

低成本高吞吐

Flash 的存在意义就是「把前沿能力打到可批量的价格」。相比 Pro 系列:

  • 输入价只有 Pro 的零头,适合高 QPS 场景(如每用户请求都调一次模型);
  • 延迟更低,交互式应用(客服、实时摘要)体验更好;
  • 配合输入缓存(见定价小节),重复前缀能压到 $0.15/1M。

函数调用与工具使用

Flash 原生支持:

  • Function Calling / Tool Use:模型可返回结构化工具调用,配合外部 API 编排;
  • 结构化输出 / JSON 模式:直接产出可解析的 JSON,省去后处理;
  • 流式(streaming):逐字返回,适合打字机式 UI。

这些是 Agent 流水线的地基——也解释了为什么它适合做「低成本 Agent 编排层」的底座模型。

适用场景详解

1. 多模态内容审核与标注

把用户上传的图片/视频/音频 + 平台规则文本一起发过去,让模型输出分类标签与理由。Flash 的低价让「每条 UGC 都过一遍模型」在经济上可行。

2. 长文档 / 大代码库理解

合同、研报、技术文档的摘要与问答;或对仓库做「这段逻辑在干嘛 / 哪里有重复 / 这个报错怎么修」类提问。1M 上下文让「少切块」成为可能。

3. 低成本 Agent 与自动化流水线

把 Flash 作为多步骤 Agent 的「执行模型」:简单决策、信息抽取、格式转换由它完成,只在遇到真正难的子任务时升级到 Pro 或外部更强模型(参见 Cursor Router 这类请求级路由思路)。

4. 实时翻译、摘要、客服对话

低延迟 + 多语言 + 流式,天然适配客服与摘要。配合 OpenRouter 这类聚合层还能做多模型兜底。

API 调用示例

基础文本

from google import genai

client = genai.Client(api_key="YOUR_API_KEY")
resp = client.models.generate_content(
    model="gemini-3.6-flash",
    contents="把这段产品评论按正面/负面分类,并给出一句话总结",
)
print(resp.text)

多模态输入(图文联合)

from google import genai
from google.genai import types

client = genai.Client(api_key="YOUR_API_KEY")
resp = client.models.generate_content(
    model="gemini-3.6-flash",
    contents=[
        "根据这张截图和语音转写,判断用户遇到的具体问题并给排查步骤",
        types.Part.from_uri("gs://your-bucket/screenshot.png", mime_type="image/png"),
        types.Part.from_uri("gs://your-bucket/audio.wav", mime_type="audio/wav"),
    ],
)
print(resp.text)

流式输出

for chunk in client.models.generate_content_stream(
    model="gemini-3.6-flash",
    contents="用三句话总结这篇文档",
):
    print(chunk.text, end="")

定价与成本核算

档位输入输出缓存输入
Gemini 3.6 Flash$1.50 / 1M$7.50 / 1M$0.15 / 1M
Gemini 3.5 Flash-Lite$0.30 / 1M$2.50 / 1M$0.03 / 1M

算一笔账:假设每天 100 万次请求,每次平均 2K 输入 / 500 输出 token,且前缀可缓存:

  • 输入:$1.50 × 2 ≈ $3.0(若命中缓存则降至 $0.15 × 2 ≈ $0.3)
  • 输出:$7.50 × 0.5 ≈ $3.75
  • 单日成本约 $6.75(命中缓存则约 $4.05),同等体量用 Pro 会贵一个数量级。

Flash 适合日常高并发,Flash-Lite 适合极致成本的超大规模自动化。

与同档模型怎么选

维度Gemini 3.6 FlashGPT-5.6 TerraClaude Sonnet 5
多模态原生全模态reasoning + vision图片
上下文1M1.1M1M
输入价(/1M)$1.50$2.50$2(促销)
编程基准未单独公布Terminal-Bench 84.3%SWE-bench 85.2%
延迟
国内可用需合规通道需中转需中转

决策树

  • 多模态感知 + 长上下文 + 低成本高并发 → Flash;
  • 硬核编程 Agent / 终端自动化 → 优先 GPT-5.6Claude Sonnet 5
  • 极致便宜的超大规模跑量 → Flash-Lite,或对照 DeepSeek V4

集成与工程实践建议

  • 用输入缓存压成本:把系统提示、知识库前缀、代码仓库上下文设为可缓存前缀,复用即享 $0.15。
  • 路由分层:把简单任务留在 Flash,复杂子任务升级到 Pro/GPT-5.6;这正是 Cursor Router 的思路。
  • 注意输出上限 65K:超长生成(如整本翻译)需分段拼接。
  • 可观测:记录每条请求的模态组合与 token 分布,多模态请求成本波动大,建议单独打点。

避坑清单

  • 别把它当编程主力:发布未给 SWE-bench / Terminal-Bench 等分数,强代码 Agent 场景先用 GPT-5.6 / Claude 验证。
  • 缓存不是默认生效:必须显式构造可复用前缀,否则一直走 $1.50 全价。
  • 1M 上下文不是免费午餐:单次长上下文调用成本随长度线性上升,按需截取。
  • 国内接入:走 Google AI Studio / Vertex AI,需合规通道;别假设能直连。

FAQ

Q: Flash 和 Pro 怎么选? A: 90% 的生产场景 Flash 够用且便宜一个量级。只在「质量天花板」卡脖子(复杂推理、最难的多模态理解)时才上 Pro。

Q: 65K 输出够吗? A: 对摘要、对话、抽取类任务绰绰有余;整本文档生成、超长代码重构需要分段。

Q: 国内怎么接入? A: 通过 Vertex AI 或合规中转;官方 AI Studio 需合规网络环境。

Q: 能替代编程 Agent 吗? A: 不适合当主力。多模态与长上下文很强,但编程基准未公布,硬核编码先对照 GPT-5.6 / Claude 的公开成绩。

延伸阅读

相关工具

相关对比

Augment Code vs Cursor:企业 AI 编程怎么选?Context Engine vs AI IDE 对比

Augment Code vs Cursor 2026 选型对比:Context Engine 全仓索引的企业 AI 平台 vs SpaceX 收购的 AI IDE 天花板,从形态、Context 覆盖、长任务、价格、合规、中文支持和适合人群 8 个维度判断,帮你选对企业 AI 编程工具。

Cursor vs Aider:GUI IDE 还是 CLI?2026 对比

Cursor vs Aider 2026 选型对比:GUI IDE vs Git 原生 CLI,从 Composer vs Architect 双模型、Tab 补全、多模型 BYOK、价格计费、开源与否和适合人群判断,帮开发者选对。Cursor 是闭源 VS Code fork 月费 $20,Aider 是开源 Apache-2.0 CLI 自带 API key。

Cursor vs Claude Code:什么时候用哪个?(2026 实测选型)

Cursor 和 Claude Code 到底怎么选?一句话结论 + 决策树 + 价格实测 + 国内可用性对比。GUI 派选 Cursor,终端长任务派选 Claude Code,最优解其实是共存。

Cursor vs GitHub Copilot:AI IDE 还是插件?2026 对比

Cursor vs GitHub Copilot 2026 选型对比:AI 原生 IDE vs IDE 插件,从 Composer vs Agent Mode、Tab 补全、多模型、AI Credits 计费、企业版和适合人群判断,帮开发者选对。Cursor 是 VS Code fork 重写交互层,Copilot 是 VS Code 插件继承原生体验。两家都已切 usage 制。

Cursor vs Trae:国内开发者怎么选?价格、模型、网络和真实体验对比

Cursor vs Trae 2026 选型对比:从价格、模型能力、国内访问、Builder/Composer、多文件改写、MCP 生态和适合人群判断,帮国内开发者决定继续用 Cursor,还是切到字节 Trae。

Cursor vs v0:AI 编程 IDE vs AI 前端生成器怎么选?

Cursor vs v0 2026 选型对比:Anysphere 的 AI 原生 IDE vs Vercel 的 AI 前端组件生成器。从定位、工作流、输出物、价格、适合人群 6 个维度帮你选对工具:全栈工程选 Cursor,快速 UI 原型选 v0。