跳到主内容
multimodalGoogle DeepMind

Gemini 3.8 Live

Google DeepMind 于 2026-09-15 发布的原生语音到语音(speech-to-speech)实时对话模型,含标准版与 Extended Thinking 两个版本。Extended Thinking 可在说话的同时后台推理、异步调用工具并实时汇报进度,以 82.6 分登顶 Artificial Analysis 语音质量指数;实测每小时输入音频成本 3.50 美元,标准版低至 0.84 美元。支持 97 种语言单次对话内切换、近实时视觉输入、128K 上下文,输出音频带 SynthID 水印。

发布 2026-09-17更新 2026-09-17核实 2026-09-17

规格

厂商
Google DeepMind
发布日期
2026/9/15
类型
multimodal
上下文窗口
131K tokens
最大输出
66K tokens
定价
音频输入 $3.00/百万 token($0.005/分钟)·音频输出 $12.00/百万 token($0.018/分钟)·文本输入 $0.75/百万·文本输出 $4.50/百万·图像视频输入 $1.00/百万
API 兼容
Gemini API, Google AI Studio

基准测试

82.6(Extended Thinking,榜首)
Artificial Analysis Speech to Speech Quality Index
98%
Big Bench Audio(语音推理)
68.6%
τ-Voice(客服任务完成率)
35.1%
τ³-Banking(银行场景,Sierra)
91.9%
Full Duplex Bench(打断与停顿)
1.35 秒
首次出声延迟
标准版 $0.84 / Extended Thinking $3.50
每小时输入音频实测成本
标准版 1083 / Extended Thinking(High)990
Speech Agent Arena(盲测 Elo)

优势

  • 原生端到端语音到语音,跳过转写与合成环节,目标端到端延迟 200ms 以内并保留完整声学上下文(语调、重音、迟疑)
  • Extended Thinking 可边推理边说话,工具调用在后台异步执行,用「让我查一下」这类自然回应填充等待,消除对话空白
  • Artificial Analysis 语音质量指数 82.6 分,为该榜最高分;Big Bench Audio 98%、τ-Voice 68.6% 均领先 GPT-Live-1
  • 成本优势显著:标准版实测每小时输入音频 0.84 美元,为该榜最低;Extended Thinking 3.50 美元仍比 GPT-Live-1 的 5.83 美元低四成
  • 97 种语言自动检测并在单次对话内中途切换,适合混合语种地区的客服与支持热线
  • 所有输出音频带 SynthID 水印,便于内容溯源与合规
  • 发布当天即有 LangChain、LiveKit、Pipecat、Agora、Vercel 原生集成,可复用现有编排层

不足

  • Live API 会话有硬时钟:纯音频 15 分钟、音频加视频 2 分钟,长对话必须自建续接逻辑
  • Extended Thinking 仅支持异步非阻塞函数调用,同步阻塞模式不可用,老代码需改造
  • turnComplete: true 的语义改变——后台推理时也会返回该标志,把它当「活干完了」会造成任务提前判定完成
  • Proactive audio 常开且不可关闭,模型会主动忽略「不是说给它听」的内容,某些场景需要额外适配
  • 标准版盲测语音竞技场 1083 Elo,低于上一代 Gemini 3.1 Flash Live 的 1096;Extended Thinking(High)990 Elo、任务成功率 89.1%,低于标准版的 93.2%
  • Full Duplex Bench(打断与停顿)91.9%,落后 GPT-Live-1 的 94.9%——真实客服里能否被自然打断,体感权重可能高于综合跑分
  • 知识截止 2025 年 1 月;模型卡自陈仍有幻觉、越狱防护待完善、偶发变慢或超时
  • 扩展思考会生成推理 token 并按输出费率计费,同一张价目表下实测账单约为标准版的四倍

适用场景

呼叫中心与客服语音 Agent(成本敏感、需要可靠打断与多语种)需要边查边答的多步语音助手:查订单、查库存、办理退款、预约改签实时语音教学与陪练(Extended Thinking 可边讲解边推理)常监听场景的主动式助手(Proactive audio 可抑制非目标语音的响应)视障辅助与实时视觉解说(近实时视觉输入 + 语音输出)替代 STT + LLM + TTS 三级级联管线,降低延迟与运维复杂度

定位一句话

Google DeepMind 于 2026-09-15 发布的原生语音到语音实时对话模型系列,含 Gemini 3.8 Live(低延迟、成本优先)与 Gemini 3.8 Live Extended Thinking(复杂任务、边想边说)两个版本,模型 ID 分别为 gemini-3.8-livegemini-3.8-live-extended-thinking

它的核心主张不是「语音版的大模型」,而是用单个端到端模型取代 STT + LLM + TTS 的三级级联管线,并把「推理」与「说话」从串行改成并行。

两个版本怎么选

维度Gemini 3.8 LiveGemini 3.8 Live Extended Thinking
定位规模化、成本效率、流畅对话、视觉 grounding复杂多步任务、推理与说话并行
工具调用同步 / 异步均可仅异步非阻塞
推理深度thinking_levelthinking_level:low / medium / high
主动音频可选常开,不可关闭
每小时成本(实测)$0.84$3.50
质量指数82.6(榜首)

选型规则:答案质量比首个字速度更重要时用 Extended Thinking;高并发、成本敏感、任务简单时用标准版。

定价

项目价格折算
音频输入$3.00 / 百万 token$0.005 / 分钟
音频输出$12.00 / 百万 token$0.018 / 分钟
文本输入$0.75 / 百万 token
文本输出$4.50 / 百万 token
图像 / 视频输入$1.00 / 百万 token$0.002 / 分钟
免费额度Google AI Studio 免费档输入输出均免费

两版标价完全相同,但 Extended Thinking 生成推理 token 并按输出费率计费。同一套任务下实测账单约为标准版的四倍——做预算请按推理 token 算,不要按标价算。

技术规格

  • 上下文窗口:128K token(131,072)输入 / 64K token(65,536)输出
  • 模态:文本、图像、音频、视频
  • 语言:97 种,单次对话内自动检测并中途切换
  • 会话限制:纯音频 15 分钟,音频加视频 2 分钟
  • 音频格式:有状态 WebSocket,输入 16-bit PCM @16kHz,输出 24kHz
  • 水印:全部输出音频带 SynthID
  • 底座:基于 Gemini 3 Pro(模型卡标注),非 Flash 系列
  • 知识截止:2025 年 1 月
  • 企业版:Gemini Enterprise 私测中

适合 / 不适合

适合

  • 呼叫中心与客服语音 Agent,尤其是多语种地区
  • 需要边查边答、工具调用链路较长的语音助手
  • 正在维护三级级联管线、想降低延迟与运维复杂度的团队
  • 成本敏感但需要接近前沿质量的语音产品

不适合

  • 需要超过 15 分钟连续会话且不愿自建续接的场景
  • 依赖同步阻塞函数调用的既有架构
  • 对「能否被自然打断」要求极高的场景(Full Duplex Bench 落后 GPT-Live-1)
  • 需要最新知识的问答(知识截止 2025 年 1 月)

相关阅读

来源

待核实:全部基准分数来自 Artificial Analysis 第三方评测,其中 GPT-Live-1 对照组仅单次试验;每小时成本为该机构按固定任务集实测值,非 Google 官方口径。Gemini Enterprise 版本处于私测。本卡由 AI 之家 编辑部基于公开资料整理,非厂商付费内容。