Qwen3.8-Omni-Flash 发布:1M 上下文全模态 Agent 模型,音频输入成本降 98%
Qwen 团队发布 Qwen3.8-Omni-Flash:继承 Qwen3.8-Next 的稀疏 MoE 架构,上下文扩到 100 万 token,输入支持文本 / 图像 / 音频(113 语言)/ 视频,只输出文本。官方论文称音频输入成本较 Qwen3.5-Omni-Plus 降超 98%、音视频降超 93%、视频降约 89%。同期开源 Qwen-MM-Plugins 与 Qwen-Live-Harness。本文核对 arXiv 论文与官方文档口径,媒体口径分歧处单独标注。
2026-09-27 · Qwen 团队论文《Qwen3.8-Omni: Towards Native Omni-Modal Agents》(arXiv:2609.25611,2026-09-22)
发布 2026-09-27核实 2026-09-27要点
- Qwen3.8-Omni-Flash 是一个「原生全模态 Agent 模型」:输入 文本 / 图像 / 音频(官方称支持 113 种语言)/ 视频,只输出文本。
- 架构:继承 Qwen3.8-Next 的稀疏 MoE(Sparse Mixture-of-Experts),上下文窗口扩展到 100 万 token。
- 上下文与输出(阿里云文档口径):非思考模式 991,808 tokens、思考模式 983,616 tokens;最大输出 131,072 tokens;推理长度上限 262K tokens。
- 媒体能力(阿里云文档口径):视频最长 2 小时 / 2 GB,采样上限 15 fps;音频最长 3 小时;支持
use_multichannel参数输入空间音频。 - 定价(第三方媒体口径):文本 输入 $0.15 / 百万 token、输出 $0.47 / 百万 token、缓存命中输入 $0.016 / 百万 token;相较 Qwen3.5-Omni-Plus,音频输入每小时成本降超 98%、音视频降超 93%、视频降约 89%。
- 同期开源两个框架:Qwen-MM-Plugins(轻量级多模态生产力插件框架)与 Qwen-Live-Harness(实时多模态 Agent 编排框架)。
- 发布形态:多家媒体称本次为 API-only,未宣布开放权重——与 2026 年 8 月开放权重的 Qwen3.8-Flash-Next 不同。有本地权重部署要求的团队需特别注意。
- 发布日口径分歧:arXiv 论文 v1 提交于 2026-09-22;部分英文媒体记为 2026-09-18,中文日报记为 2026-09-26。本文以可核实的 arXiv 提交日 2026-09-22 为锚点,其余口径并列保留。
- 可用地域(阿里云 Model Studio 文档口径):新加坡、日本(东京)、德国(法兰克福)、美国(弗吉尼亚)、中国(北京)、中国香港。
背景与分析
从「看得见」到「会干活」:全模态模型的定位变了
过去几代 Omni 模型的卖点集中在感知与交互——能听懂、能看见、能对话。Qwen3.8-Omni 论文里明确把目标改成了 native omni-modal agents:让音视频从「被感知的输入」变成「Agent 赖以推理与执行的媒介」。
具体落点是三类长程任务:视频剪辑、长音频 / 长视频翻译、以及「按音乐条件生成 MV / 电影」这类生成式编排。它们共同的特点是不是一问一答能完成,需要规划、调工具、多步执行。
这个转向背后的技术动作是 native multimodal co-training:在保留文本域能力的前提下,把 Agent 能力从文本迁移到音视频任务上。关键是「保留文本域能力」——历史上多模态化的常见代价是文本推理退化,论文把这一点当成前提而不是副产品。
「Agentic perception」:让模型自己决定看哪一段
最值得注意的工程细节是它怎么看视频。
传统做法是固定间隔抽帧——均匀采样,成本与长度线性相关,而且大量帧是废帧。Qwen 的做法是两级扫描:先粗扫定位相关片段,再对那一段细看。官方把它放进 Agent 工作流里,称这是该系列首次把「全模态感知」做成 Agent 工作流的一环。
代价是 token 消耗变成内容相关的——不同视频的实际花销差异很大。第三方报道给出的两个数字并不一致:一处称某任务从 145,736 token 降到 79,117(降 45.7%),另一处称 OmniVideoBench 上降 51.8%、Agent 平均分较上一代提升 19.5 分。两个都是厂商 / 媒体口径,本站未做一手实测,建议按「量级参考」而非「确定收益」理解。
这也是本文最想提醒的一点:「每百万 token 多少钱」在全模态模型上不等于「每小时音视频多少钱」——后者的 token 消耗率取决于时长、帧率,以及模型自己决定细看多少。做预算必须跑自己的最坏情况,不能套平均。
补齐的是「harness 缺口」,这个判断是对的
论文里有一句很实在的话:现有 agent harness 缺少原生音视频支持。
这不是自谦。当前主流编程 Agent(Claude Code、Gemini CLI 等)的输入通道基本是文本 + 图像;给它们喂一段两小时的视频,你得自己在外部先转写、再切片、再拼进上下文。Qwen-MM-Plugins 想填的就是这一层——把多模态输入接进既有 Agent 框架。
方向对不对另说,但**「模型厂商开始为 harness 层负责」本身是个信号**:模型能力已经不是唯一瓶颈了。
API-only 是个明确的取舍
这点必须讲清楚:多家媒体称本次未宣布开放权重(第三方口径,官方论文未明确表态,属待确认项)。
对国内很多团队,Qwen 系列的价值很大一部分来自「权重可下载、可私有部署」。而音频与视频恰恰是最容易携带个人信息的数据类型。如果上一代你是靠本地权重过的合规,这一代不是 drop-in 替代品。
对开发者的影响
- 先算「每小时」而不是「每百万 token」。 agentic perception 让消耗随内容浮动,务必跑自己的最坏情况样本。
- 长音频场景值得重估。 会议录音、客服通话、授课录像——音频成本降一个量级会改变「值不值得做」的结论。
- 有本地部署硬要求的,先别规划迁移。 开放权重未见官宣(待确认);上一代 Qwen3.8-Flash-Next(2026-08)有开放权重。
- 关注两个开源框架,而不是只关注模型。 Qwen-MM-Plugins / Qwen-Live-Harness 是这次更可复用的部分,插件框架可以接到你已有的 Agent 上。
- 扩展思考默认开在最高档,可通过参数关闭——成本敏感的场景记得关,否则默认按最高推理长度计费。
- 基准数据要打折看。 第三方基准追踪站指出该模型在其收录的 446 个基准中只有 19 个有结果,暂无综合分。当前 Agent 类数字应视为厂商自报。
AI 之家 观点
其一,全模态模型的竞争点已经从「支持几种输入」变成「能不能在模态上做规划」。 「支持音频输入」在 2026 年不是卖点,「让 Agent 自己决定听哪一段、看哪几帧」才是。Qwen 把感知做成 Agent 工作流的一环,是对的方向——它把成本从固定开销变成了可优化的变量。
其二,成本降 98% 这个数字,真正的意义是解锁新场景而不是省钱。 音频从「按小时算很贵」变成「随便发」,改变的是什么值得做:以前客服质检只能抽样,现在可以全量;以前会议纪要只做重点场次,现在可以默认全做。价格跨过某个阈值后,架构决策会变。
其三,token 消耗「不可预测」是新的运维负担。 固定抽帧的成本是可算的,agentic perception 的成本是内容相关的。厂商拿到的是好看的平均数,用户承担的是方差。 上线前请务必压测最坏情况。
其四,API-only 与「数据不出境/不出内网」的诉求正面冲突。 音视频是最敏感的输入类型,而它跑在公有云上。这不是 Qwen 一家的取舍,是全模态能力商业化的普遍路径——但对国内合规要求高的行业,它直接决定这个模型能不能进选型清单。
相关阅读
- 概念:长上下文 · MoE 混合专家 · 智能体编程 · 智能体编排
- 工具:Claude Code · Gemini CLI
- 模型:Qwen3-Coder · Qwen3-8 LiveTranslate · Qwen3 · Step 5 Preview
来源
- Qwen3.8-Omni: Towards Native Omni-Modal Agents(Qwen 团队,arXiv:2609.25611,v1 提交 2026-09-22) — 一手来源:架构(稀疏 MoE / Qwen3.8-Next)、1M 上下文、native multimodal co-training、Qwen-MM-Plugins 与 Qwen-Live-Harness 的定位以此为准
- Alibaba Cloud Model Studio — Qwen3.8-Omni-Flash 模型文档 — 上下文 / 输出 / 媒体时长 / 可用地域等规格口径
- Qwen3.8-Omni-Flash cuts audio input costs by 98%(Tech AI Wire / DEV) — 第三方来源:定价、降本百分比、参数规模、API-only 均出自此类媒体,官方论文未逐项确认,标注为待核实
本条由 AI 之家 编辑部根据 arXiv 论文原文与主流媒体整理,未做一手实测。待确认项:① 发布日(arXiv 09-22 / 媒体 09-18 / 中文日报 09-26 三种口径);② 是否开放权重(媒体称 API-only,官方未明确);③ 全部定价与降本百分比(第三方口径);④ 参数规模(第三方称约 125B 总参 / 512 专家 / 约 6B 激活 / 51B embedding 表,论文未给出)。规格与价格随产品阶段变化,落地前请以阿里云官方模型文档与定价页为准。 欢迎在 反馈邮箱 反馈更新。