Gemini 3.6 Flash
Google 于 2026 年 7 月 21 日发布的稳定版 Flash 模型,1M 上下文、65K 输出,定价 $1.50/$7.50 每百万 token,定位高吞吐多模态场景,原生支持函数调用与流式。
发布 2026-07-27更新 2026-07-27规格
- 厂商
- 发布日期
- 2026/7/21
- 类型
- multimodal
- 上下文窗口
- 1049K tokens
- 最大输出
- 66K tokens
- 定价
- $1.50 / $7.50(cache $0.15)/ 百万 token
- API 兼容
- google, vertex
✓ 优势
- •原生多模态:文本 / 图像 / 视频 / 音频统一输入,响应快
- •1M 输入上下文 + 65K 输出,长文档与代码库友好
- •Flash 定位低价低延迟,适合高吞吐自动化与 Agent
- •Google AI Studio / Vertex AI 全托管,接入简单
- •原生函数调用、结构化输出与流式,工程接入成本低
⚠ 不足
- •独立于编程(SWE-bench / Terminal-Bench 等)基准未随发布公布,编程 Agent 场景仍以 GPT-5.6 / Claude 为主流参照
- •输入缓存需命中才享 $0.15,短请求收益有限
- •国内直连需合规通道(AI Studio / Vertex AI)
适用场景
概述
Gemini 3.6 Flash 是 Google 于 2026 年 7 月 21 日在 Gemini API 上线的稳定版(stable) Flash 模型。它延续 Flash 系列的「低价、低延迟、原生多模态」定位,提供 1,048,576 token 输入上下文与 65,536 token 输出上限,官方定价 $1.50 输入 / $7.50 输出 / $0.15 缓存输入(每百万 token)。
在 Gemini 的产品阶梯里,3.6 Flash 处在「性价比中枢」:
- Gemini 3 Pro / 3.5 Pro:能力天花板,贵,适合最难的任务;
- Gemini 3.6 Flash(本文):能力够用、便宜、快,绝大多数生产场景的默认档;
- Gemini 3.5 Flash-Lite(同批上线,$0.30/$2.50):极致成本,适合超大规模、对质量容忍度高的自动化。
同批上线的还有 Gemini 3.5 Flash-Lite(7 月 21 日,定位超大规模自动化,$0.30/$2.50 输入/输出)。「stable」意味着它不再是预览/实验通道,SLA、版本稳定性与定价都进入长期维护状态——这对生产接入很关键。
核心能力
原生多模态:一次输入,多种信号
Gemini 3.6 Flash 的图像、视频、音频与文本是统一模态(native multimodal),不需要像很多模型那样先把图片转成独立视觉 token 或走单独的视觉子模型。带来的直接好处:
- 一条请求里可以同时塞「一段产品演示视频 + 几张截图 + 一段用户语音 + 文字指令」,模型一并理解;
- 适合「感知型」工作流:内容审核、视频摘要、带图客服、多模态 RAG。
对比:不少模型对图片是「附加上下文」,Gemini 的强项是把视频/音频也当成一等公民。如果你的场景只是「看图回答问题」,差异不明显;但若涉及视频时序理解或音视频联合推理,Flash 的多模态原生度更有体感。
长上下文工程实践
1M 输入上下文意味着你可以把一整本书、一份几百页 PDF、或一个中型代码仓库直接放进一次请求。但实际落地有讲究:
- 不要无脑塞满:超长上下文单次成本更高,且模型对「中间段」信息的注意力会衰减(lost-in-the-middle)。优先放与当前任务最相关的片段。
- 长文档 RAG 的新玩法:对 1M 上下文,很多场景可以从「切块召回」退化为「整文档直读」,省掉向量库与召回链路,但要在成本与延迟间权衡。
- 代码库问答:把
README+ 关键模块 + 报错栈一起喂进去,比只贴报错栈有效得多。
低成本高吞吐
Flash 的存在意义就是「把前沿能力打到可批量的价格」。相比 Pro 系列:
- 输入价只有 Pro 的零头,适合高 QPS 场景(如每用户请求都调一次模型);
- 延迟更低,交互式应用(客服、实时摘要)体验更好;
- 配合输入缓存(见定价小节),重复前缀能压到 $0.15/1M。
函数调用与工具使用
Flash 原生支持:
- Function Calling / Tool Use:模型可返回结构化工具调用,配合外部 API 编排;
- 结构化输出 / JSON 模式:直接产出可解析的 JSON,省去后处理;
- 流式(streaming):逐字返回,适合打字机式 UI。
这些是 Agent 流水线的地基——也解释了为什么它适合做「低成本 Agent 编排层」的底座模型。
适用场景详解
1. 多模态内容审核与标注
把用户上传的图片/视频/音频 + 平台规则文本一起发过去,让模型输出分类标签与理由。Flash 的低价让「每条 UGC 都过一遍模型」在经济上可行。
2. 长文档 / 大代码库理解
合同、研报、技术文档的摘要与问答;或对仓库做「这段逻辑在干嘛 / 哪里有重复 / 这个报错怎么修」类提问。1M 上下文让「少切块」成为可能。
3. 低成本 Agent 与自动化流水线
把 Flash 作为多步骤 Agent 的「执行模型」:简单决策、信息抽取、格式转换由它完成,只在遇到真正难的子任务时升级到 Pro 或外部更强模型(参见 Cursor Router 这类请求级路由思路)。
4. 实时翻译、摘要、客服对话
低延迟 + 多语言 + 流式,天然适配客服与摘要。配合 OpenRouter 这类聚合层还能做多模型兜底。
API 调用示例
基础文本
from google import genai
client = genai.Client(api_key="YOUR_API_KEY")
resp = client.models.generate_content(
model="gemini-3.6-flash",
contents="把这段产品评论按正面/负面分类,并给出一句话总结",
)
print(resp.text)
多模态输入(图文联合)
from google import genai
from google.genai import types
client = genai.Client(api_key="YOUR_API_KEY")
resp = client.models.generate_content(
model="gemini-3.6-flash",
contents=[
"根据这张截图和语音转写,判断用户遇到的具体问题并给排查步骤",
types.Part.from_uri("gs://your-bucket/screenshot.png", mime_type="image/png"),
types.Part.from_uri("gs://your-bucket/audio.wav", mime_type="audio/wav"),
],
)
print(resp.text)
流式输出
for chunk in client.models.generate_content_stream(
model="gemini-3.6-flash",
contents="用三句话总结这篇文档",
):
print(chunk.text, end="")
定价与成本核算
| 档位 | 输入 | 输出 | 缓存输入 |
|---|---|---|---|
| Gemini 3.6 Flash | $1.50 / 1M | $7.50 / 1M | $0.15 / 1M |
| Gemini 3.5 Flash-Lite | $0.30 / 1M | $2.50 / 1M | $0.03 / 1M |
算一笔账:假设每天 100 万次请求,每次平均 2K 输入 / 500 输出 token,且前缀可缓存:
- 输入:$1.50 × 2 ≈ $3.0(若命中缓存则降至 $0.15 × 2 ≈ $0.3)
- 输出:$7.50 × 0.5 ≈ $3.75
- 单日成本约 $6.75(命中缓存则约 $4.05),同等体量用 Pro 会贵一个数量级。
Flash 适合日常高并发,Flash-Lite 适合极致成本的超大规模自动化。
与同档模型怎么选
| 维度 | Gemini 3.6 Flash | GPT-5.6 Terra | Claude Sonnet 5 |
|---|---|---|---|
| 多模态 | ★★★★★ 原生全模态 | reasoning + vision | 图片 |
| 上下文 | 1M | 1.1M | 1M |
| 输入价(/1M) | $1.50 | $2.50 | $2(促销) |
| 编程基准 | 未单独公布 | Terminal-Bench 84.3% | SWE-bench 85.2% |
| 延迟 | 低 | 中 | 中 |
| 国内可用 | 需合规通道 | 需中转 | 需中转 |
决策树:
- 要多模态感知 + 长上下文 + 低成本高并发 → Flash;
- 要硬核编程 Agent / 终端自动化 → 优先 GPT-5.6 或 Claude Sonnet 5;
- 要极致便宜的超大规模跑量 → Flash-Lite,或对照 DeepSeek V4。
集成与工程实践建议
- 用输入缓存压成本:把系统提示、知识库前缀、代码仓库上下文设为可缓存前缀,复用即享 $0.15。
- 路由分层:把简单任务留在 Flash,复杂子任务升级到 Pro/GPT-5.6;这正是 Cursor Router 的思路。
- 注意输出上限 65K:超长生成(如整本翻译)需分段拼接。
- 可观测:记录每条请求的模态组合与 token 分布,多模态请求成本波动大,建议单独打点。
避坑清单
- 别把它当编程主力:发布未给 SWE-bench / Terminal-Bench 等分数,强代码 Agent 场景先用 GPT-5.6 / Claude 验证。
- 缓存不是默认生效:必须显式构造可复用前缀,否则一直走 $1.50 全价。
- 1M 上下文不是免费午餐:单次长上下文调用成本随长度线性上升,按需截取。
- 国内接入:走 Google AI Studio / Vertex AI,需合规通道;别假设能直连。
FAQ
Q: Flash 和 Pro 怎么选? A: 90% 的生产场景 Flash 够用且便宜一个量级。只在「质量天花板」卡脖子(复杂推理、最难的多模态理解)时才上 Pro。
Q: 65K 输出够吗? A: 对摘要、对话、抽取类任务绰绰有余;整本文档生成、超长代码重构需要分段。
Q: 国内怎么接入? A: 通过 Vertex AI 或合规中转;官方 AI Studio 需合规网络环境。
Q: 能替代编程 Agent 吗? A: 不适合当主力。多模态与长上下文很强,但编程基准未公布,硬核编码先对照 GPT-5.6 / Claude 的公开成绩。
延伸阅读
- 同档对照:GPT-5.6 / Claude Sonnet 5 / Gemini 3 Pro / DeepSeek V4
- 配套工具:Cursor / OpenRouter / Claude Code
- 相关资讯:Gemini 3.6 Flash 发布