阿里千问发布实时同传模型 Qwen3.8-LiveTranslate:字均延迟从 2.8 秒压到 2.3 秒
2026-09-20 · 千问官方微博 / IT之家 / DoNews / 驱动中国 / BlockBeats
要点
- 2026-09-19,阿里千问正式发布实时同声传译大模型 Qwen3.8-LiveTranslate,主打「同传不只翻译得快,更能听得清、译得准,并保留人物与上下文信息」。
- 核心指标:字均延迟(LAAL,衡量同传平均滞后时间)从上一代的 2.8 秒降至 2.3 秒(约 -18%)。
- 架构:采用基于 Hybrid MoE 的 Thinker–Talker 双模块设计,以 Interleave(音频-文本交织) 方式衔接流式理解、文本输出与语音生成。Thinker 把视频、音频、原文与译文编排进同一条因果序列按时序交替排列、端到端产出;Talker 结合译文与源音频,合成保留原说话人音色的译文语音。
- 单流可缓存:同传被重构为音频-文本交织的单流形式,已听音频与已出译文均可缓存复用——这是延迟与成本同步下降的工程基础。
- 三大新能力(在支持 60 种语言的基础上):
- 实时说话人分离——多人交替发言时区分说话人与发言内容,译文语音稳定保留对应音色;
- 原文译文同帧同出——原文与译文同步流式返回、双语对齐,兼顾即时理解与原文核对;
- 长上下文消歧——结合前文与历史语境,减少专有名词、人物指代带来的歧义。
- 评测(官方口径):在覆盖 14 个语向的多说话人长音频评测集 Omnilingua-MSpeaker 上,忠实度、流畅度、简洁度与说话人分离错误率(DER)四个维度均优于当前主流实时同传系统;在公开 FLEURS 音频测试集的 70 个语言方向上,翻译质量、字均延迟、语音识别准确率与语音合成质量四维领先上一代及主流系统。
- API 同步开放,价格基本持平:北京区音频输入、图片输入、文本输出、音频输出四项价格与上一代 Qwen3.5-LiveTranslate 完全相同,新加坡区四项价格还略有下降。
- 体验入口:omni.qwen.ai/live-translate;API 模型 ID:
qwen3.8-livetranslate-flash-realtime。
背景与分析
一、同传的竞争维度已经从「翻得准」变成「翻得像现场」
上一代实时同传产品的竞争焦点是准确率与语言覆盖;Qwen3.8-LiveTranslate 这一代把三件「人肉同传才有的东西」做进了模型默认能力:分清谁在说、保留谁在说、记住之前说过什么。
这三件事恰好对应真实会议的三类高频翻车场景:多人抢话(说话人分离)、需要核对原文的同屏场景(双语对齐)、长会议里的人名与术语(上下文消歧)。官方没有把「更准」当卖点,而是把「可用性」当卖点——这是同传产品从 demo 走向生产环境信号。
二、单流交织架构是延迟与成本的共同解
传统同传管线是「ASR → 翻译 → TTS」三级级联,每级都有延迟与误差累积。Qwen3.8-LiveTranslate 的 Interleave 架构把已听音频、已出译文放进同一条因果序列,带来两个直接后果:
- 已出译文可复用——重复内容不重算,LAAL 从 2.8 秒压到 2.3 秒的同时,算力成本反而可控;
- 上下文天然连续——消歧不需要额外的记忆组件,长会议里的人名、指代在序列内自然衔接。
这与语音 Agent 领域「端到端取代级联」的趋势一致(参见 Gemini 3.8 Live 的同类主张)——实时语音方向正在收敛到同一个架构答案。
三、价格持平的信号:抢的是场景入口,不是模型溢价
在同档 Qwen3.8-Max 因高价被对比的背景下,同传接口不涨价(北京区四项价格与上代完全相同)意图明显:会议、直播、客服这些实时场景是高频入口,先用功能增强 + 成本稳定把入口占住。叠加千问办公的既有用户盘,这步棋卡的是生态位而不是单次调用的毛利。
对开发者的影响
- 做会议/直播/客服产品的,本周值得实测三项能力:说话人分离的音色稳定性、双语同屏的延迟体感、长会议(1 小时以上)的术语一致性——这三项是上一代产品最常见的差评来源,也是换模型的直接理由。
- 接入成本低:API 模型 ID
qwen3.8-livetranslate-flash-realtime,价格与上代持平意味着存量同传工作流可以直接平移升级,无需重新做成本测算。 - 延迟敏感场景按 LAAL 2.3 秒做体验预算:字幕滚动、同声传译耳语等场景,2.3 秒的字均滞后已接近「可用」与「难受」的分界线;实测时用自己的真实语料,不要只看官方评测集。
- 多语言覆盖的边界:官方口径为 60 种语言;上一代曾支持 3500 语言对(含长尾语种),如果你的场景依赖小语种,升级前先核对覆盖清单。
- 模型路由视角:千问系 API 兼容 OpenAI 接口风格,配合 OpenRouter 等网关可与其余语音模型做 A/B,但实时语音流的路由切换需自测会话连续性。
AI 之家 观点
- 这代发布最值得记的是「架构收敛」:实时语音方向上,端到端单流正在同时赢得延迟、成本与上下文连续性三个战场,级联管线的时间不多了。做语音产品的团队,新项目不建议再基于「ASR + LLM + TTS」起架构。
- 「价格持平 + 功能增强」是效率型模型竞争的标准打法,与本月 DeepSeek V4.1 Flash、GLM-5.3 Flash 的定价策略一脉相承——中国厂商在实时交互赛道上打的不是旗舰溢价,是场景渗透。
- 同传是 AI 落地里「看起来简单、做起来最难」的场景之一:低延迟、双向流、说话人分离、术语一致、音色保留,五个约束同时成立。谁把这五个约束做成默认能力而不只是参数开关,谁就拿到会议市场的默认选项——千问这步走到了多数同行前面。
- 冷静项:全部评测数据为官方口径(Omnilingua-MSpeaker 与 FLEURS 均以「优于主流系统」定性呈现,未给具体分数),第三方独立复测出现前,选型请以自己的真实语料实测为准。
相关阅读
- 模型卡:Qwen3.8-LiveTranslate · Gemini 3.8 Live · Qwen3-Coder · Qwen-3
- 资讯:Google 发布 Gemini 3.8 Live 与 Extended Thinking
- 工具卡:OpenRouter
- 概念:上下文工程 · AI Agent
来源
- 阿里千问发布同声传译大模型 Qwen3.8-LiveTranslate — 腾讯新闻(IT之家)
- 千问大模型发布 Qwen3.8-LiveTranslate 优化实时同传技术 — 千问官方微博
- 阿里千问发布实时同传大模型 Qwen3.8-LiveTranslate — DoNews
- 阿里千问发布 Qwen3.8-LiveTranslate,字均延迟降至 2.3 秒 — 驱动中国(经今日头条)
- 千问同传模型 Qwen3.8-LiveTranslate 发布,延迟降 18% — BlockBeats
待核实:LAAL 2.3 秒、Omnilingua-MSpeaker 与 FLEURS 评测结论均为官方口径,未见第三方独立复现与具体分数;「60 种语言」与上一代「3500 语言对」的口径差异待官方文档澄清;各地 API 实际价格以阿里云价目表为准。本资讯由 AI 之家 编辑部基于公开资料整理,非厂商付费内容。