跳到主内容

Google 发布 Gemini 3.8 Live 与 Extended Thinking:实时语音 Agent 进入「边想边说」时代

2026-09-17 · Google DeepMind / Google AI Studio / Artificial Analysis / DataNorth

要点

  • 2026-09-15 Google DeepMind 发布 Gemini 3.8 LiveGemini 3.8 Live Extended Thinking 两款原生 语音到语音(speech-to-speech) 模型,同日通过 Gemini API 与 Google AI Studio 开放。
  • Extended Thinking 在 Artificial Analysis Speech to Speech Quality Index 得 82.6 分,为目前该榜最高分,领先 OpenAI GPT-Live-1 的 81.5 分。
  • 成本差距远大于分数差距:Artificial Analysis 按固定任务集实测,Extended Thinking 每小时输入音频 3.50 美元,标准版 0.84 美元;GPT-Live-1 为 5.83 美元、Grok Voice Think Fast 2.0 High 为 4.80 美元。
  • 定价(两款同价):音频输入 3.00 美元 / 百万 token(0.005 美元/分钟),音频输出 12.00 美元 / 百万 token(0.018 美元/分钟),文本输入 0.75、文本输出 4.50、图像视频输入 1.00 美元 / 百万 token。
  • Extended Thinking 可以「边推理边说话」:遇到多步任务时先给出「让我查一下」之类的自然回应,再在后台推进工具调用并实时汇报进度;仅支持异步非阻塞函数调用,同步阻塞模式不可用。
  • 两款模型均为 128K 上下文 / 64K 输出,支持 97 种语言在单次对话内自动检测并中途切换,输出音频全部带 SynthID 水印;模型卡标注基于 Gemini 3 Pro 构建、知识截止 2025 年 1 月

背景与分析

一、语音 Agent 的瓶颈从来不是「聪不聪明」,是「中间那段空白」

传统语音 Agent 是三级瀑布管线:语音转文本 → LLM 处理 → 文本转语音。每一次交接都加延迟,业界常用的现实估计是 450~1000 毫秒 的额外处理时间;更关键的是,转写这一步会丢掉语调、重音、迟疑这些韵律信息——而模型恰恰需要这些信息才能判断用户到底想说什么。

Gemini 3.8 Live 是端到端单模型:音频进、音频出,中间没有独立的转写与合成环节。Google 给出的目标是端到端 200 毫秒以内,并且保留完整声学上下文。

Extended Thinking 补上了另一半。语音 Agent 最破坏体验的时刻,是问完问题到听到回答之间的停顿,而且问题越难、停顿越长。Extended Thinking 的做法是把推理和说话并行:模型一边说「我帮你查一下」,一边在后台跑工具调用,跑完再继续汇报。

这不是用 UX 话术掩盖等待,而是把等待改造成了进度播报。

二、分数接近,价格拉开——2026 年的竞争形态写在这两个数字里

指标Gemini 3.8 Live Extended ThinkingGPT-Live-1(Astra, medium)
Speech to Speech Index(综合质量)82.681.5
Big Bench Audio(语音推理)98%90%
τ-Voice(客服类任务完成率)68.6%67.9%
τ³-Banking(银行场景)35.1%32.0%
Full Duplex Bench(打断与停顿)91.9%94.9%
首次出声延迟1.35 秒1.34 秒
每小时输入音频成本3.50 美元5.83 美元

数据来自 Artificial Analysis,Google 在发布帖中引用了同样的 τ-Voice 与 Big Bench Audio 数值。需要说明两点:一是 GPT-Live-1 那一栏只跑了一次(多数模型跑三次),噪声更大;二是 Full Duplex Bench 上 GPT-Live-1 仍然领先。

真正值得记住的是这个组合:综合质量只差 1.1 分,成本差 40%。 前沿模型之间的能力差距已经小到可以用钱换算——这和 DeepSeek V4.1-Flash 在 Agent Arena 上「每任务中位成本 0.07 美元、比第二名低 68% 而成绩只差 0.09 个百分点」是同一件事。

三、看起来同价,账单能差四倍

两款模型在 Google 的价目表上共用一行,标价完全相同。但 Extended Thinking 会生成推理 token,而推理 token 按输出费率计费。Artificial Analysis 在同一套固定任务上实测的结果是:Extended Thinking 3.50 美元/小时,标准 Live 0.84 美元/小时——同一张价目表,账单差约四倍。

按这个成本结构换算,一个月处理 1 万小时音频的客服机器人:用 GPT-Live-1 约 5.83 万美元,用 Extended Thinking 约 3.5 万美元,用标准 Live 约 8400 美元。呼叫中心与消费级语音产品的经济性拐点,是被这条曲线推出来的,不是被跑分推出来的。

四、能力边界:别被 82.6 分带偏

  • 标准版在盲测语音竞技场反而略低:Gemini 3.8 Live 得 1083 Elo,低于 Gemini 3.1 Flash Live 的 1096;Extended Thinking(High)990 Elo、任务成功率 89.1%,标准版 93.2%,Grok Voice Think Fast 2.0 High 以 94.6% 领先该项。
  • 会话有硬时钟:Live API 限制纯音频会话 15 分钟、音频加视频会话 2 分钟。长对话必须自己设计续接逻辑。
  • turnComplete: true 语义变了:Extended Thinking 在后台推理时也会返回该标志,把它当「活干完了」的老代码要重写
  • Proactive audio 常开:模型可以主动判断「这句话不是说给我听的」从而不回应,适合常监听场景,但无法关闭。
  • 模型卡自陈短板:幻觉、越狱防护仍在持续、偶发变慢或超时,以及 2025 年 1 月的知识截止。

对开发者的影响

  • 正在用级联管线的,现在是重写的时候了。 端到端模型在延迟、韵律保留、打断处理三项上结构性占优,而且标准版价格已经低到 0.84 美元/小时,继续维护三级瀑布的性价比正在消失
  • 别直接按标价做预算,按推理 token 做。 同一价目表下标准版与 Extended Thinking 的实测账单差四倍,先用 --runs 1 或小样本把 reasoning 开销测出来再决定档位。
  • 检查你的 turnComplete 逻辑。 从 Extended Thinking 迁移过来时,这个标志不再代表模型空闲,误判会导致任务被提前判定完成。
  • 长会话必须自建续接机制。 15 分钟 / 2 分钟的会话上限是硬的,客服、陪练、教学这类场景一开始就要设计 session resumption。
  • 语音 Agent 的选型权重该改了。 过去是「质量优先、成本次之」,现在质量差 1.1 分、成本差 40%,成本应该进第一梯队指标。参见 上下文工程MCP
  • 国内团队注意合规与可达性。 Gemini API 在国内直连不稳定,出海业务可用,国内业务需评估网络与数据出境要求。

AI 之家 观点

  1. Google 这次真正的杀招不是 82.6 分,是把语音 Agent 的单位成本打到 1 美元/小时以内。 82.6 与 81.5 的差距用户听不出来,0.84 与 5.83 的差距 CFO 看得见。语音 Agent 从「能做」到「值得做」的门槛,是被标准版的定价跨过去的。
  2. 「同一价目表、四倍账单」是这一代推理模型最容易被低估的坑。 标价已经不能用来估算成本,推理 token 才是真实计费单元。这与 AI 编程周报 2026-09-16 里「订阅制涨价、开源档降价本质是毛利防御」是同一个逻辑的两面:厂商在为推理成本找人买单。
  3. 端到端语音会重塑一批中间件的价值。 当转写环节被模型吞掉,专门做 STT/TTS 中间层的护城河在变薄;真正的壁垒移到会话状态管理、工具编排、可观测性。LangChain、LiveKit、Pipecat、Agora、Vercel 在发布当天就有原生集成,说明生态已经提前站位。
  4. Full Duplex Bench 的落后值得留意。 打断点这个指标上 GPT-Live-1 仍然领先 3 个百分点——真实客服场景里,能不能被自然打断,体感权重可能高于跑分。选型时别只看综合指数。
  5. 对国内开发者的现实意义有限但方向明确。 Gemini API 直连不稳定是现实约束,但「端到端 + 推理与说话并行」这条架构路线值得跟踪——国内厂商做语音大模型时大概率会走同一条路,届时迁移成本会很低。

相关阅读

来源

待核实:τ-Voice、Big Bench Audio、Speech to Speech Index 均为 Artificial Analysis 第三方评测,其中 GPT-Live-1 一栏仅单次试验;每小时成本为该机构按固定任务集实测值,非 Google 官方口径。Gemini Enterprise 版本处于私测阶段。本资讯由 AI 之家 编辑部整理,非厂商付费内容。

相关对比

Aider vs Claude Code:终端 AI 编程双雄怎么选

Aider vs Claude Code 2026 选型对比:开源 BYOK 多模型 vs Anthropic 订阅长任务 Agent,从编程能力、多模型支持、价格、Git 集成、国内可用性和适合人群判断,帮你选对终端 AI 编程工具。

Claude Code vs Cline:CLI AI Agent 怎么选?2026 对比

Claude Code vs Cline 2026 选型对比:Anthropic 官方闭源 CLI Agent vs Apache-2.0 开源 VS Code 插件。从模型绑定、工作流、MCP 支持、价格、隐私和适合人群 6 个维度帮你选对 CLI AI 编程工具。

Claude Code vs Codex CLI:终端 AI Agent 双雄对比

Claude Code vs Codex CLI 2026 选型对比:Anthropic 与 OpenAI 两大官方终端 Agent 的模型、长任务、MCP 生态、Windows 支持、订阅打包价格和国内可用性全方位对比,帮你判断该用哪个终端 AI Agent,以及能不能两个一起用。

Claude Code vs Crush:Anthropic 官方 vs 多模型 TUI(2026 实测选型)

Claude Code vs Crush 2026 选型对比:Anthropic 官方 CLI Agent(Claude only + 长任务最稳 + MCP 一等公民)vs Charmbracelet 开源 TUI Agent(多模型 mid-session 切换 + LSP + FSL-1.1-MIT)。从模型、长任务、生态、价格、国内可用性帮你选对终端 AI 编程工具。

Claude Code vs Gemini CLI:终端 AI Agent 怎么选?(2026 选型指南)

Claude Code 和 Gemini CLI 都是终端原生的 AI 编码 Agent。一句话结论 + 决策树 + 价格 + 国内可用性对比:长任务与 CLAUDE.md 生态选前者,免费额度与接入门槛选后者。

Cursor vs Claude Code:什么时候用哪个?(2026 实测选型)

Cursor 和 Claude Code 到底怎么选?一句话结论 + 决策树 + 价格实测 + 国内可用性对比。GUI 派选 Cursor,终端长任务派选 Claude Code,最优解其实是共存。

相关评测