Google 发布 Gemini 3.6 Flash:1M 上下文、每百万 token $1.50 起
2026-07-21 · benchr(援引 Google)
要点
- Gemini 3.6 Flash 于 2026-07-21 作为**稳定版(stable)**在 Gemini API 上线。
- 1,048,576 token 输入上下文,65,536 token 输出上限。
- 官方定价 $1.50 输入 / $7.50 输出 / $0.15 缓存输入(每百万 token)。
- 同批上线 Gemini 3.5 Flash-Lite($0.30/$2.50,面向超大规模自动化)。
- 接入面:Google AI Studio、Vertex AI、Gemini Developer API 均可用。
发布细节:为什么是「stable」很重要
此前 Flash 系列常先以预览/实验通道放出,版本号漂移、SLA 不稳,生产接入要自己踩坑。这次标 stable,意味着:
- 版本进入长期维护,行为可预期;
- 定价固化,便于做成本预算;
- 适合直接进生产,而非「先试试」。
对要做长期产品的团队,这是比参数本身更关键的信号。
Flash 产品线的来龙去脉
Google 的 Flash 档位一路从 1.5 → 2.0 → 2.5 → 3.0 → 3.5 → 现在的 3.6,主线就一条:把多模态 + 长上下文打到可批量的价格。每一代都在「更便宜 / 更长上下文 / 更低延迟」上推进,而不是去和 Pro 抢榜单第一。3.6 Flash 把上下文拉到 1M、输出 65K,同时保持 $1.50 的低位输入价,明显是冲着「高并发多模态 + 长上下文 RAG」场景去的。
技术要点拆解
- 1M 上下文:可整文档/整仓库直读,很多 RAG 场景能省掉向量召回链路,但长上下文单次成本更高,需按需截取(详见模型详解)。
- $0.15 缓存输入:把系统提示/知识库前缀设为可缓存前缀,复用即享 1/10 价格——这是把高并发成本真正压下来的关键开关。
- 原生多模态:图/视频/音频与文本统一输入,视频时序理解是相对差异化能力。
- Flash-Lite 兜底:对质量容忍度高的超大规模跑量,再降一档到 $0.30/$2.50。
对生态的连锁反应
- 多模态 Agent 成本下降:图像/视频/音频统一输入 + 低价,让「感知型」Agent 跑量更划算。
- 与 GPT-5.6 / Claude 的分工更清晰:Google 用 Flash 守成本与多模态,OpenAI/Anthropic 在编程 Agent 基准上仍更常被引用(见 GPT-5.6 / Claude Sonnet 5)。
- 聚合层直接受益:Cursor / OpenRouter 等多一个便宜的多模态档可选,路由分层更顺。
谁该关注,谁可以等
- 该关注:做内容审核、文档理解、多模态客服、长上下文 RAG、低成本 Agent 的团队——这是比 Pro 更友好的默认档。
- 可以等:纯编程 Agent、对 SWE-bench/Terminal-Bench 成绩敏感的团队,建议等 Google 公布独立编程基准再评估。
上手步骤(5 分钟跑通)
- 打开 Google AI Studio,创建 API Key;
- 选模型
gemini-3.6-flash; - 先发一条文本请求验证连通;
- 把高频前缀(系统提示/知识库)设为缓存,观察单价降到 $0.15;
- 接入生产前先用 模型详解里的成本公式估一遍日活成本。
AIHO 观点
Gemini 3.6 Flash 不是「最强模型」,而是「最划算的多模态工作马」之一。它的价值不在刷榜,而在把长上下文 + 多模态 + 低单价三件事同时做实。对大多数要做内容审核、文档理解、客服对话的团队,它比 Pro 更该成为默认档——但涉及硬核编程 Agent,仍建议先拿 GPT-5.6 / Claude Sonnet 5 的公开基准比对。