Google 发布 Gemini 3.8 Live 与 Extended Thinking:实时语音 Agent 进入「边想边说」时代
2026-09-17 · Google DeepMind / Google AI Studio / Artificial Analysis / DataNorth
要点
- 2026-09-15 Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款原生 语音到语音(speech-to-speech) 模型,同日通过 Gemini API 与 Google AI Studio 开放。
- Extended Thinking 在 Artificial Analysis Speech to Speech Quality Index 得 82.6 分,为目前该榜最高分,领先 OpenAI GPT-Live-1 的 81.5 分。
- 成本差距远大于分数差距:Artificial Analysis 按固定任务集实测,Extended Thinking 每小时输入音频 3.50 美元,标准版 0.84 美元;GPT-Live-1 为 5.83 美元、Grok Voice Think Fast 2.0 High 为 4.80 美元。
- 定价(两款同价):音频输入 3.00 美元 / 百万 token(0.005 美元/分钟),音频输出 12.00 美元 / 百万 token(0.018 美元/分钟),文本输入 0.75、文本输出 4.50、图像视频输入 1.00 美元 / 百万 token。
- Extended Thinking 可以「边推理边说话」:遇到多步任务时先给出「让我查一下」之类的自然回应,再在后台推进工具调用并实时汇报进度;仅支持异步非阻塞函数调用,同步阻塞模式不可用。
- 两款模型均为 128K 上下文 / 64K 输出,支持 97 种语言在单次对话内自动检测并中途切换,输出音频全部带 SynthID 水印;模型卡标注基于 Gemini 3 Pro 构建、知识截止 2025 年 1 月。
背景与分析
一、语音 Agent 的瓶颈从来不是「聪不聪明」,是「中间那段空白」
传统语音 Agent 是三级瀑布管线:语音转文本 → LLM 处理 → 文本转语音。每一次交接都加延迟,业界常用的现实估计是 450~1000 毫秒 的额外处理时间;更关键的是,转写这一步会丢掉语调、重音、迟疑这些韵律信息——而模型恰恰需要这些信息才能判断用户到底想说什么。
Gemini 3.8 Live 是端到端单模型:音频进、音频出,中间没有独立的转写与合成环节。Google 给出的目标是端到端 200 毫秒以内,并且保留完整声学上下文。
Extended Thinking 补上了另一半。语音 Agent 最破坏体验的时刻,是问完问题到听到回答之间的停顿,而且问题越难、停顿越长。Extended Thinking 的做法是把推理和说话并行:模型一边说「我帮你查一下」,一边在后台跑工具调用,跑完再继续汇报。
这不是用 UX 话术掩盖等待,而是把等待改造成了进度播报。
二、分数接近,价格拉开——2026 年的竞争形态写在这两个数字里
| 指标 | Gemini 3.8 Live Extended Thinking | GPT-Live-1(Astra, medium) |
|---|---|---|
| Speech to Speech Index(综合质量) | 82.6 | 81.5 |
| Big Bench Audio(语音推理) | 98% | 90% |
| τ-Voice(客服类任务完成率) | 68.6% | 67.9% |
| τ³-Banking(银行场景) | 35.1% | 32.0% |
| Full Duplex Bench(打断与停顿) | 91.9% | 94.9% |
| 首次出声延迟 | 1.35 秒 | 1.34 秒 |
| 每小时输入音频成本 | 3.50 美元 | 5.83 美元 |
数据来自 Artificial Analysis,Google 在发布帖中引用了同样的 τ-Voice 与 Big Bench Audio 数值。需要说明两点:一是 GPT-Live-1 那一栏只跑了一次(多数模型跑三次),噪声更大;二是 Full Duplex Bench 上 GPT-Live-1 仍然领先。
真正值得记住的是这个组合:综合质量只差 1.1 分,成本差 40%。 前沿模型之间的能力差距已经小到可以用钱换算——这和 DeepSeek V4.1-Flash 在 Agent Arena 上「每任务中位成本 0.07 美元、比第二名低 68% 而成绩只差 0.09 个百分点」是同一件事。
三、看起来同价,账单能差四倍
两款模型在 Google 的价目表上共用一行,标价完全相同。但 Extended Thinking 会生成推理 token,而推理 token 按输出费率计费。Artificial Analysis 在同一套固定任务上实测的结果是:Extended Thinking 3.50 美元/小时,标准 Live 0.84 美元/小时——同一张价目表,账单差约四倍。
按这个成本结构换算,一个月处理 1 万小时音频的客服机器人:用 GPT-Live-1 约 5.83 万美元,用 Extended Thinking 约 3.5 万美元,用标准 Live 约 8400 美元。呼叫中心与消费级语音产品的经济性拐点,是被这条曲线推出来的,不是被跑分推出来的。
四、能力边界:别被 82.6 分带偏
- 标准版在盲测语音竞技场反而略低:Gemini 3.8 Live 得 1083 Elo,低于 Gemini 3.1 Flash Live 的 1096;Extended Thinking(High)990 Elo、任务成功率 89.1%,标准版 93.2%,Grok Voice Think Fast 2.0 High 以 94.6% 领先该项。
- 会话有硬时钟:Live API 限制纯音频会话 15 分钟、音频加视频会话 2 分钟。长对话必须自己设计续接逻辑。
turnComplete: true语义变了:Extended Thinking 在后台推理时也会返回该标志,把它当「活干完了」的老代码要重写。- Proactive audio 常开:模型可以主动判断「这句话不是说给我听的」从而不回应,适合常监听场景,但无法关闭。
- 模型卡自陈短板:幻觉、越狱防护仍在持续、偶发变慢或超时,以及 2025 年 1 月的知识截止。
对开发者的影响
- 正在用级联管线的,现在是重写的时候了。 端到端模型在延迟、韵律保留、打断处理三项上结构性占优,而且标准版价格已经低到 0.84 美元/小时,继续维护三级瀑布的性价比正在消失。
- 别直接按标价做预算,按推理 token 做。 同一价目表下标准版与 Extended Thinking 的实测账单差四倍,先用
--runs 1或小样本把 reasoning 开销测出来再决定档位。 - 检查你的
turnComplete逻辑。 从 Extended Thinking 迁移过来时,这个标志不再代表模型空闲,误判会导致任务被提前判定完成。 - 长会话必须自建续接机制。 15 分钟 / 2 分钟的会话上限是硬的,客服、陪练、教学这类场景一开始就要设计 session resumption。
- 语音 Agent 的选型权重该改了。 过去是「质量优先、成本次之」,现在质量差 1.1 分、成本差 40%,成本应该进第一梯队指标。参见 上下文工程 与 MCP。
- 国内团队注意合规与可达性。 Gemini API 在国内直连不稳定,出海业务可用,国内业务需评估网络与数据出境要求。
AI 之家 观点
- Google 这次真正的杀招不是 82.6 分,是把语音 Agent 的单位成本打到 1 美元/小时以内。 82.6 与 81.5 的差距用户听不出来,0.84 与 5.83 的差距 CFO 看得见。语音 Agent 从「能做」到「值得做」的门槛,是被标准版的定价跨过去的。
- 「同一价目表、四倍账单」是这一代推理模型最容易被低估的坑。 标价已经不能用来估算成本,推理 token 才是真实计费单元。这与 AI 编程周报 2026-09-16 里「订阅制涨价、开源档降价本质是毛利防御」是同一个逻辑的两面:厂商在为推理成本找人买单。
- 端到端语音会重塑一批中间件的价值。 当转写环节被模型吞掉,专门做 STT/TTS 中间层的护城河在变薄;真正的壁垒移到会话状态管理、工具编排、可观测性。LangChain、LiveKit、Pipecat、Agora、Vercel 在发布当天就有原生集成,说明生态已经提前站位。
- Full Duplex Bench 的落后值得留意。 打断点这个指标上 GPT-Live-1 仍然领先 3 个百分点——真实客服场景里,能不能被自然打断,体感权重可能高于跑分。选型时别只看综合指数。
- 对国内开发者的现实意义有限但方向明确。 Gemini API 直连不稳定是现实约束,但「端到端 + 推理与说话并行」这条架构路线值得跟踪——国内厂商做语音大模型时大概率会走同一条路,届时迁移成本会很低。
相关阅读
- 工具卡:Devin · Claude Code
- 模型卡:Gemini 3.8 Live · Gemini 3.8 Flash · GPT-6 Astra
- 概念:MCP · 上下文工程 · Agentic Coding
- 往期资讯:AI 编程周报 2026-09-16 · AI 编程周报 2026-09-15 · AI 减速论与算力股下挫
来源
- Google launches Gemini 3.8 Live and Extended Thinking — DataNorth
- Gemini 3.8 Live Extended Thinking 模型页 — AI/TLDR
- Google releases Gemini 3.8 Live with bidirectional voice — AI Primer
- Gemini 3.8 Live Launches: Voice Agents Beat GPT-Live-1 — ByteIota
- 腾讯研究院 AI 速递 20260917 — 搜狐
待核实:τ-Voice、Big Bench Audio、Speech to Speech Index 均为 Artificial Analysis 第三方评测,其中 GPT-Live-1 一栏仅单次试验;每小时成本为该机构按固定任务集实测值,非 Google 官方口径。Gemini Enterprise 版本处于私测阶段。本资讯由 AI 之家 编辑部整理,非厂商付费内容。