跳到主内容
AIHO 2026 全新改版上线
multimodalGoogle

Gemini 3.6 Flash

Google 于 2026 年 7 月 21 日发布的稳定版 Flash 模型,1M 上下文、65K 输出,定价 $1.50/$7.50 每百万 token,定位高吞吐多模态场景,原生支持函数调用与流式。

发布 2026-07-27更新 2026-07-27

规格

厂商
Google
发布日期
2026/7/21
类型
multimodal
上下文窗口
1049K tokens
最大输出
66K tokens
定价
$1.50 / $7.50(cache $0.15)/ 百万 token
API 兼容
google, vertex

✓ 优势

  • 原生多模态:文本 / 图像 / 视频 / 音频统一输入,响应快
  • 1M 输入上下文 + 65K 输出,长文档与代码库友好
  • Flash 定位低价低延迟,适合高吞吐自动化与 Agent
  • Google AI Studio / Vertex AI 全托管,接入简单
  • 原生函数调用、结构化输出与流式,工程接入成本低

⚠ 不足

  • 独立于编程(SWE-bench / Terminal-Bench 等)基准未随发布公布,编程 Agent 场景仍以 GPT-5.6 / Claude 为主流参照
  • 输入缓存需命中才享 $0.15,短请求收益有限
  • 国内直连需合规通道(AI Studio / Vertex AI)

适用场景

高并发多模态内容生成与审核长上下文 RAG / 文档理解低成本 Agent 与自动化流水线实时翻译、摘要、客服对话

概述

Gemini 3.6 Flash 是 Google 于 2026 年 7 月 21 日在 Gemini API 上线的稳定版(stable) Flash 模型。它延续 Flash 系列的「低价、低延迟、原生多模态」定位,提供 1,048,576 token 输入上下文65,536 token 输出上限,官方定价 $1.50 输入 / $7.50 输出 / $0.15 缓存输入(每百万 token)。

在 Gemini 的产品阶梯里,3.6 Flash 处在「性价比中枢」:

  • Gemini 3 Pro / 3.5 Pro:能力天花板,贵,适合最难的任务;
  • Gemini 3.6 Flash(本文):能力够用、便宜、快,绝大多数生产场景的默认档;
  • Gemini 3.5 Flash-Lite(同批上线,$0.30/$2.50):极致成本,适合超大规模、对质量容忍度高的自动化。

同批上线的还有 Gemini 3.5 Flash-Lite(7 月 21 日,定位超大规模自动化,$0.30/$2.50 输入/输出)。「stable」意味着它不再是预览/实验通道,SLA、版本稳定性与定价都进入长期维护状态——这对生产接入很关键。

核心能力

原生多模态:一次输入,多种信号

Gemini 3.6 Flash 的图像、视频、音频与文本是统一模态(native multimodal),不需要像很多模型那样先把图片转成独立视觉 token 或走单独的视觉子模型。带来的直接好处:

  • 一条请求里可以同时塞「一段产品演示视频 + 几张截图 + 一段用户语音 + 文字指令」,模型一并理解;
  • 适合「感知型」工作流:内容审核、视频摘要、带图客服、多模态 RAG。

对比:不少模型对图片是「附加上下文」,Gemini 的强项是把视频/音频也当成一等公民。如果你的场景只是「看图回答问题」,差异不明显;但若涉及视频时序理解音视频联合推理,Flash 的多模态原生度更有体感。

长上下文工程实践

1M 输入上下文意味着你可以把一整本书、一份几百页 PDF、或一个中型代码仓库直接放进一次请求。但实际落地有讲究:

  • 不要无脑塞满:超长上下文单次成本更高,且模型对「中间段」信息的注意力会衰减(lost-in-the-middle)。优先放与当前任务最相关的片段。
  • 长文档 RAG 的新玩法:对 1M 上下文,很多场景可以从「切块召回」退化为「整文档直读」,省掉向量库与召回链路,但要在成本与延迟间权衡。
  • 代码库问答:把 README + 关键模块 + 报错栈一起喂进去,比只贴报错栈有效得多。

低成本高吞吐

Flash 的存在意义就是「把前沿能力打到可批量的价格」。相比 Pro 系列:

  • 输入价只有 Pro 的零头,适合高 QPS 场景(如每用户请求都调一次模型);
  • 延迟更低,交互式应用(客服、实时摘要)体验更好;
  • 配合输入缓存(见定价小节),重复前缀能压到 $0.15/1M。

函数调用与工具使用

Flash 原生支持:

  • Function Calling / Tool Use:模型可返回结构化工具调用,配合外部 API 编排;
  • 结构化输出 / JSON 模式:直接产出可解析的 JSON,省去后处理;
  • 流式(streaming):逐字返回,适合打字机式 UI。

这些是 Agent 流水线的地基——也解释了为什么它适合做「低成本 Agent 编排层」的底座模型。

适用场景详解

1. 多模态内容审核与标注

把用户上传的图片/视频/音频 + 平台规则文本一起发过去,让模型输出分类标签与理由。Flash 的低价让「每条 UGC 都过一遍模型」在经济上可行。

2. 长文档 / 大代码库理解

合同、研报、技术文档的摘要与问答;或对仓库做「这段逻辑在干嘛 / 哪里有重复 / 这个报错怎么修」类提问。1M 上下文让「少切块」成为可能。

3. 低成本 Agent 与自动化流水线

把 Flash 作为多步骤 Agent 的「执行模型」:简单决策、信息抽取、格式转换由它完成,只在遇到真正难的子任务时升级到 Pro 或外部更强模型(参见 Cursor Router 这类请求级路由思路)。

4. 实时翻译、摘要、客服对话

低延迟 + 多语言 + 流式,天然适配客服与摘要。配合 OpenRouter 这类聚合层还能做多模型兜底。

API 调用示例

基础文本

from google import genai

client = genai.Client(api_key="YOUR_API_KEY")
resp = client.models.generate_content(
    model="gemini-3.6-flash",
    contents="把这段产品评论按正面/负面分类,并给出一句话总结",
)
print(resp.text)

多模态输入(图文联合)

from google import genai
from google.genai import types

client = genai.Client(api_key="YOUR_API_KEY")
resp = client.models.generate_content(
    model="gemini-3.6-flash",
    contents=[
        "根据这张截图和语音转写,判断用户遇到的具体问题并给排查步骤",
        types.Part.from_uri("gs://your-bucket/screenshot.png", mime_type="image/png"),
        types.Part.from_uri("gs://your-bucket/audio.wav", mime_type="audio/wav"),
    ],
)
print(resp.text)

流式输出

for chunk in client.models.generate_content_stream(
    model="gemini-3.6-flash",
    contents="用三句话总结这篇文档",
):
    print(chunk.text, end="")

定价与成本核算

档位输入输出缓存输入
Gemini 3.6 Flash$1.50 / 1M$7.50 / 1M$0.15 / 1M
Gemini 3.5 Flash-Lite$0.30 / 1M$2.50 / 1M$0.03 / 1M

算一笔账:假设每天 100 万次请求,每次平均 2K 输入 / 500 输出 token,且前缀可缓存:

  • 输入:$1.50 × 2 ≈ $3.0(若命中缓存则降至 $0.15 × 2 ≈ $0.3)
  • 输出:$7.50 × 0.5 ≈ $3.75
  • 单日成本约 $6.75(命中缓存则约 $4.05),同等体量用 Pro 会贵一个数量级。

Flash 适合日常高并发,Flash-Lite 适合极致成本的超大规模自动化。

与同档模型怎么选

维度Gemini 3.6 FlashGPT-5.6 TerraClaude Sonnet 5
多模态★★★★★ 原生全模态reasoning + vision图片
上下文1M1.1M1M
输入价(/1M)$1.50$2.50$2(促销)
编程基准未单独公布Terminal-Bench 84.3%SWE-bench 85.2%
延迟
国内可用需合规通道需中转需中转

决策树

  • 多模态感知 + 长上下文 + 低成本高并发 → Flash;
  • 硬核编程 Agent / 终端自动化 → 优先 GPT-5.6Claude Sonnet 5
  • 极致便宜的超大规模跑量 → Flash-Lite,或对照 DeepSeek V4

集成与工程实践建议

  • 用输入缓存压成本:把系统提示、知识库前缀、代码仓库上下文设为可缓存前缀,复用即享 $0.15。
  • 路由分层:把简单任务留在 Flash,复杂子任务升级到 Pro/GPT-5.6;这正是 Cursor Router 的思路。
  • 注意输出上限 65K:超长生成(如整本翻译)需分段拼接。
  • 可观测:记录每条请求的模态组合与 token 分布,多模态请求成本波动大,建议单独打点。

避坑清单

  • 别把它当编程主力:发布未给 SWE-bench / Terminal-Bench 等分数,强代码 Agent 场景先用 GPT-5.6 / Claude 验证。
  • 缓存不是默认生效:必须显式构造可复用前缀,否则一直走 $1.50 全价。
  • 1M 上下文不是免费午餐:单次长上下文调用成本随长度线性上升,按需截取。
  • 国内接入:走 Google AI Studio / Vertex AI,需合规通道;别假设能直连。

FAQ

Q: Flash 和 Pro 怎么选? A: 90% 的生产场景 Flash 够用且便宜一个量级。只在「质量天花板」卡脖子(复杂推理、最难的多模态理解)时才上 Pro。

Q: 65K 输出够吗? A: 对摘要、对话、抽取类任务绰绰有余;整本文档生成、超长代码重构需要分段。

Q: 国内怎么接入? A: 通过 Vertex AI 或合规中转;官方 AI Studio 需合规网络环境。

Q: 能替代编程 Agent 吗? A: 不适合当主力。多模态与长上下文很强,但编程基准未公布,硬核编码先对照 GPT-5.6 / Claude 的公开成绩。

延伸阅读

相关工具