跳到主内容
AIHO 2026 全新改版上线

Google 发布 Gemini 3.6 Flash:1M 上下文、每百万 token $1.50 起

2026-07-21 · benchr(援引 Google)

要点

  • Gemini 3.6 Flash2026-07-21 作为**稳定版(stable)**在 Gemini API 上线。
  • 1,048,576 token 输入上下文,65,536 token 输出上限。
  • 官方定价 $1.50 输入 / $7.50 输出 / $0.15 缓存输入(每百万 token)。
  • 同批上线 Gemini 3.5 Flash-Lite($0.30/$2.50,面向超大规模自动化)。
  • 接入面:Google AI Studio、Vertex AI、Gemini Developer API 均可用。

发布细节:为什么是「stable」很重要

此前 Flash 系列常先以预览/实验通道放出,版本号漂移、SLA 不稳,生产接入要自己踩坑。这次标 stable,意味着:

  • 版本进入长期维护,行为可预期;
  • 定价固化,便于做成本预算;
  • 适合直接进生产,而非「先试试」。

对要做长期产品的团队,这是比参数本身更关键的信号。

Flash 产品线的来龙去脉

Google 的 Flash 档位一路从 1.5 → 2.0 → 2.5 → 3.0 → 3.5 → 现在的 3.6,主线就一条:把多模态 + 长上下文打到可批量的价格。每一代都在「更便宜 / 更长上下文 / 更低延迟」上推进,而不是去和 Pro 抢榜单第一。3.6 Flash 把上下文拉到 1M、输出 65K,同时保持 $1.50 的低位输入价,明显是冲着「高并发多模态 + 长上下文 RAG」场景去的。

技术要点拆解

  • 1M 上下文:可整文档/整仓库直读,很多 RAG 场景能省掉向量召回链路,但长上下文单次成本更高,需按需截取(详见模型详解)。
  • $0.15 缓存输入:把系统提示/知识库前缀设为可缓存前缀,复用即享 1/10 价格——这是把高并发成本真正压下来的关键开关。
  • 原生多模态:图/视频/音频与文本统一输入,视频时序理解是相对差异化能力。
  • Flash-Lite 兜底:对质量容忍度高的超大规模跑量,再降一档到 $0.30/$2.50。

对生态的连锁反应

  • 多模态 Agent 成本下降:图像/视频/音频统一输入 + 低价,让「感知型」Agent 跑量更划算。
  • 与 GPT-5.6 / Claude 的分工更清晰:Google 用 Flash 守成本与多模态,OpenAI/Anthropic 在编程 Agent 基准上仍更常被引用(见 GPT-5.6 / Claude Sonnet 5)。
  • 聚合层直接受益Cursor / OpenRouter 等多一个便宜的多模态档可选,路由分层更顺。

谁该关注,谁可以等

  • 该关注:做内容审核、文档理解、多模态客服、长上下文 RAG、低成本 Agent 的团队——这是比 Pro 更友好的默认档。
  • 可以等:纯编程 Agent、对 SWE-bench/Terminal-Bench 成绩敏感的团队,建议等 Google 公布独立编程基准再评估。

上手步骤(5 分钟跑通)

  1. 打开 Google AI Studio,创建 API Key;
  2. 选模型 gemini-3.6-flash
  3. 先发一条文本请求验证连通;
  4. 把高频前缀(系统提示/知识库)设为缓存,观察单价降到 $0.15;
  5. 接入生产前先用 模型详解里的成本公式估一遍日活成本。

AIHO 观点

Gemini 3.6 Flash 不是「最强模型」,而是「最划算的多模态工作马」之一。它的价值不在刷榜,而在把长上下文 + 多模态 + 低单价三件事同时做实。对大多数要做内容审核、文档理解、客服对话的团队,它比 Pro 更该成为默认档——但涉及硬核编程 Agent,仍建议先拿 GPT-5.6 / Claude Sonnet 5 的公开基准比对

相关阅读