跳到主内容
multimodal阿里巴巴(通义千问)

Qwen3.8-LiveTranslate

阿里千问 2026-09-19 发布的实时同声传译大模型:Interleave 架构 + Hybrid MoE Thinker–Talker 双模块,字均延迟(LAAL)2.8 秒降至 2.3 秒,支持 60 种语言;新增实时说话人分离、原文译文同帧同出、长上下文消歧三大能力,官方评测在 Omnilingua-MSpeaker 与 FLEURS 上领先主流实时同传系统。

发布 2026-09-20更新 2026-09-20核实 2026-09-20

规格

厂商
阿里巴巴(通义千问)
发布日期
2026/9/19
类型
multimodal
定价
API 价格与上一代 Qwen3.5-LiveTranslate 基本持平(北京区四项价格完全相同 · 新加坡区略降)
API 兼容
Qwen API, DashScope

基准测试

2.3 秒(上代 2.8 秒)
字均延迟 LAAL
忠实度/流畅度/简洁度/DER 四维官方称优于主流系统
Omnilingua-MSpeaker(14 语向多说话人)
翻译质量/延迟/ASR/TTS 四维官方称领先上代与主流
FLEURS(70 语向)

优势

  • 字均延迟(LAAL)从上代 2.8 秒降至 2.3 秒,官方评测在翻译质量、延迟、ASR、TTS 四维领先主流系统
  • 实时说话人分离:多人交替发言可区分说话人,译文语音稳定保留对应音色
  • 原文译文同帧同出:双语同步流式返回,兼顾即时理解与原文核对,天然适配字幕场景
  • 长上下文消歧:结合前文语境处理人名、术语与指代,长会议一致性更好
  • 音频-文本交织单流架构,已听音频与已出译文均可缓存复用,延迟与成本同步受益
  • API 价格与上一代基本持平,存量同传工作流可平移升级

不足

  • 评测结论均为官方口径(未公布具体分数),未见第三方独立复现
  • 官方口径支持 60 种语言,上一代 3500 语言对的长尾覆盖是否保留待官方文档澄清
  • 实时语音流场景的会话连续性、断流重连等工程细节公开资料有限
  • 音色克隆保真度在嘈杂多人场景下的表现缺乏公开基准

适用场景

线上会议与跨境会议的实时字幕与同传直播带货、在线教育的双语实时字幕呼叫中心与客服的实时通话翻译采访、播客等多人音频的转写 + 翻译一体流水线

定位一句话

阿里千问于 2026-09-19 发布的实时同声传译大模型:用 Interleave 单流架构把「听清、译准、留人、记前文」做成默认能力,主打会议、直播、客服等真实同传场景的可用性而非跑分。

核心能力

Interleave 架构:单流替代级联

传统同传走「ASR → 翻译 → TTS」级联,延迟与误差逐级累积。Qwen3.8-LiveTranslate 采用基于 Hybrid MoE 的 Thinker–Talker 双模块

  • Thinker:把视频、音频、原文、译文编排进同一条因果序列,按时序交替排列、端到端产出——理解与翻译在单一序列内完成;
  • Talker:结合译文与源音频,把译文合成为保留原说话人音色的语音。

因为音频与文本在同一条流里,已听音频和已出译文都可以缓存复用——这是 LAAL 从 2.8 秒压到 2.3 秒的工程基础,也让长会议的成本曲线更平。

三大场景能力

能力解决什么
实时说话人分离多人抢话时「谁说的算谁的」,译文语音按人保留音色
原文译文同帧同出双语同屏对齐,听众可即时核对原文,字幕场景直接可用
长上下文消歧结合前文处理人名、术语、指代,一小时以上的会议不「失忆」

官方评测(官方口径,无具体分数)

  • Omnilingua-MSpeaker(14 语向多说话人长音频):忠实度、流畅度、简洁度、说话人分离错误率(DER)四维均优于当前主流实时同传系统;
  • FLEURS(70 个语言方向):翻译质量、字均延迟、语音识别准确率、语音合成质量四维领先上一代与主流系统。

获取方式与定价(2026-09 核对)

通道说明
在线体验omni.qwen.ai/live-translate
API模型 ID qwen3.8-livetranslate-flash-realtime(阿里云百炼/DashScope)
定价北京区音频输入、图片输入、文本输出、音频输出四项与上一代完全相同;新加坡区四项略降

定价为 2026-09-20 依据公开报道核对,实时价格以阿里云价目表为准。

适合 / 不适合

适合

  • 会议、直播、客服等需要低延迟双语实时字幕的产品
  • 多人交替发言、需要按说话人区分译文的场景
  • 依赖长会议术语一致性的专业领域(法务、医疗、技术评审)
  • 已有 Qwen3.5-LiveTranslate 工作流、想平移升级的团队

不适合

  • 依赖小语种长尾覆盖的场景(上一代 3500 语言对口径是否保留待核实)
  • 需要第三方验证基准分数再采购的合规型团队(当前全部为官方口径)
  • 离线批处理翻译(非本模型定位,普通文本模型更划算)

相关阅读

来源

待核实:全部评测结论为官方口径,未见第三方独立复现与具体分数;上下文窗口长度官方未披露,故本卡未填该字段;各地 API 实际价格以阿里云价目表为准。本卡由 AI 之家 编辑部根据公开资料整理,非厂商付费内容;定价与功能以官网为准,欢迎在 反馈邮箱 反馈更新。