Gemini 3.8 Live
Google DeepMind 于 2026-09-15 发布的原生语音到语音(speech-to-speech)实时对话模型,含标准版与 Extended Thinking 两个版本。Extended Thinking 可在说话的同时后台推理、异步调用工具并实时汇报进度,以 82.6 分登顶 Artificial Analysis 语音质量指数;实测每小时输入音频成本 3.50 美元,标准版低至 0.84 美元。支持 97 种语言单次对话内切换、近实时视觉输入、128K 上下文,输出音频带 SynthID 水印。
发布 2026-09-17更新 2026-09-17核实 2026-09-17规格
- 厂商
- Google DeepMind
- 发布日期
- 2026/9/15
- 类型
- multimodal
- 上下文窗口
- 131K tokens
- 最大输出
- 66K tokens
- 定价
- 音频输入 $3.00/百万 token($0.005/分钟)·音频输出 $12.00/百万 token($0.018/分钟)·文本输入 $0.75/百万·文本输出 $4.50/百万·图像视频输入 $1.00/百万
- API 兼容
- Gemini API, Google AI Studio
基准测试
优势
- •原生端到端语音到语音,跳过转写与合成环节,目标端到端延迟 200ms 以内并保留完整声学上下文(语调、重音、迟疑)
- •Extended Thinking 可边推理边说话,工具调用在后台异步执行,用「让我查一下」这类自然回应填充等待,消除对话空白
- •Artificial Analysis 语音质量指数 82.6 分,为该榜最高分;Big Bench Audio 98%、τ-Voice 68.6% 均领先 GPT-Live-1
- •成本优势显著:标准版实测每小时输入音频 0.84 美元,为该榜最低;Extended Thinking 3.50 美元仍比 GPT-Live-1 的 5.83 美元低四成
- •97 种语言自动检测并在单次对话内中途切换,适合混合语种地区的客服与支持热线
- •所有输出音频带 SynthID 水印,便于内容溯源与合规
- •发布当天即有 LangChain、LiveKit、Pipecat、Agora、Vercel 原生集成,可复用现有编排层
不足
- •Live API 会话有硬时钟:纯音频 15 分钟、音频加视频 2 分钟,长对话必须自建续接逻辑
- •Extended Thinking 仅支持异步非阻塞函数调用,同步阻塞模式不可用,老代码需改造
- •turnComplete: true 的语义改变——后台推理时也会返回该标志,把它当「活干完了」会造成任务提前判定完成
- •Proactive audio 常开且不可关闭,模型会主动忽略「不是说给它听」的内容,某些场景需要额外适配
- •标准版盲测语音竞技场 1083 Elo,低于上一代 Gemini 3.1 Flash Live 的 1096;Extended Thinking(High)990 Elo、任务成功率 89.1%,低于标准版的 93.2%
- •Full Duplex Bench(打断与停顿)91.9%,落后 GPT-Live-1 的 94.9%——真实客服里能否被自然打断,体感权重可能高于综合跑分
- •知识截止 2025 年 1 月;模型卡自陈仍有幻觉、越狱防护待完善、偶发变慢或超时
- •扩展思考会生成推理 token 并按输出费率计费,同一张价目表下实测账单约为标准版的四倍
适用场景
定位一句话
Google DeepMind 于 2026-09-15 发布的原生语音到语音实时对话模型系列,含 Gemini 3.8 Live(低延迟、成本优先)与 Gemini 3.8 Live Extended Thinking(复杂任务、边想边说)两个版本,模型 ID 分别为 gemini-3.8-live 与 gemini-3.8-live-extended-thinking。
它的核心主张不是「语音版的大模型」,而是用单个端到端模型取代 STT + LLM + TTS 的三级级联管线,并把「推理」与「说话」从串行改成并行。
两个版本怎么选
| 维度 | Gemini 3.8 Live | Gemini 3.8 Live Extended Thinking |
|---|---|---|
| 定位 | 规模化、成本效率、流畅对话、视觉 grounding | 复杂多步任务、推理与说话并行 |
| 工具调用 | 同步 / 异步均可 | 仅异步非阻塞 |
| 推理深度 | 无 thinking_level | thinking_level:low / medium / high |
| 主动音频 | 可选 | 常开,不可关闭 |
| 每小时成本(实测) | $0.84 | $3.50 |
| 质量指数 | — | 82.6(榜首) |
选型规则:答案质量比首个字速度更重要时用 Extended Thinking;高并发、成本敏感、任务简单时用标准版。
定价
| 项目 | 价格 | 折算 |
|---|---|---|
| 音频输入 | $3.00 / 百万 token | $0.005 / 分钟 |
| 音频输出 | $12.00 / 百万 token | $0.018 / 分钟 |
| 文本输入 | $0.75 / 百万 token | — |
| 文本输出 | $4.50 / 百万 token | — |
| 图像 / 视频输入 | $1.00 / 百万 token | $0.002 / 分钟 |
| 免费额度 | Google AI Studio 免费档 | 输入输出均免费 |
两版标价完全相同,但 Extended Thinking 生成推理 token 并按输出费率计费。同一套任务下实测账单约为标准版的四倍——做预算请按推理 token 算,不要按标价算。
技术规格
- 上下文窗口:128K token(131,072)输入 / 64K token(65,536)输出
- 模态:文本、图像、音频、视频
- 语言:97 种,单次对话内自动检测并中途切换
- 会话限制:纯音频 15 分钟,音频加视频 2 分钟
- 音频格式:有状态 WebSocket,输入 16-bit PCM @16kHz,输出 24kHz
- 水印:全部输出音频带 SynthID
- 底座:基于 Gemini 3 Pro(模型卡标注),非 Flash 系列
- 知识截止:2025 年 1 月
- 企业版:Gemini Enterprise 私测中
适合 / 不适合
适合
- 呼叫中心与客服语音 Agent,尤其是多语种地区
- 需要边查边答、工具调用链路较长的语音助手
- 正在维护三级级联管线、想降低延迟与运维复杂度的团队
- 成本敏感但需要接近前沿质量的语音产品
不适合
- 需要超过 15 分钟连续会话且不愿自建续接的场景
- 依赖同步阻塞函数调用的既有架构
- 对「能否被自然打断」要求极高的场景(Full Duplex Bench 落后 GPT-Live-1)
- 需要最新知识的问答(知识截止 2025 年 1 月)
相关阅读
- 资讯:Google 发布 Gemini 3.8 Live 与 Extended Thinking · AI 编程周报 2026-09-17
- 同系列:Gemini 3.8 Flash · Gemini 3.7 Flash · Gemini 3 Pro
- 对比模型:GPT-6 Astra · Claude Fable 5.1 · GLM-5.3
- 概念:上下文工程 · MCP · Agentic Coding
来源
- Google launches Gemini 3.8 Live and Extended Thinking — DataNorth
- Gemini 3.8 Live Extended Thinking 模型页 — AI/TLDR
- Google releases Gemini 3.8 Live with bidirectional voice — AI Primer
- Gemini 3.8 Live Launches: Voice Agents Beat GPT-Live-1 — ByteIota
- 腾讯研究院 AI 速递 20260917 — 搜狐
待核实:全部基准分数来自 Artificial Analysis 第三方评测,其中 GPT-Live-1 对照组仅单次试验;每小时成本为该机构按固定任务集实测值,非 Google 官方口径。Gemini Enterprise 版本处于私测。本卡由 AI 之家 编辑部基于公开资料整理,非厂商付费内容。