阿里发布并开源 Qwen3.8-Flash:125B 参数只激活 6B,训练成本降 90%,推理价击穿 DeepSeek
2026-08-26 · 36氪 / IT之家 / 阿里云百炼
要点
- 阿里通义千问团队 2026-08-26 晚正式发布 Qwen3.8-Flash,并同步开源。
- 多模态 MoE 架构:总参数 125B,每 token 仅激活约 6B(另有约 51B 的 N-gram embedding 缓存参数,以官方技术报告口径为准)。
- 官方称激活 6B 即可获得超越 Claude Opus 4.6 的前沿性能,「创下模型效率的全球新基准」。
- 训练成本较 Qwen3.7-Plus 骤降近 90%,推理成本同步大降:每百万 token 输入 ¥1 / 输出 ¥3,官方称最低至 DeepSeek-V4-Flash 的约 1/3。
- Qwen3.8-Flash-Next 开源权重同步放出(Hugging Face + 魔搭社区,含 FP8 量化版,SGLang / vLLM day-0 支持),官方称其新架构是下一代 Qwen4 系列的雏形。
- 商用通道:首发上线「千问办公」,开发者和企业可通过千问 AI 平台(百炼)获取 API。
背景与分析
这是 8 月国产开源模型的第二场「效率战」——同一晚,智谱也开源了 GLM-5.3-Flash(见相关阅读)。两家不约而同放弃了「堆总参数」的旧打法,转向极低激活比例的稀疏 MoE:
| 模型 | 总参数 | 激活参数 | 激活比例 |
|---|---|---|---|
| Qwen3.8-Flash | 125B | ~6B | ~4.8% |
| GLM-5.3-Flash | 320B | ~18B | ~5.6% |
激活参数决定推理成本,总参数决定知识容量。当 6B 激活就能摸到上一代旗舰的性能水位,意味着两件事:推理价格还有大幅下探空间(¥1/¥3 已接近「白菜价」),以及开源模型的自部署门槛进一步降低——6B 激活量的模型,单卡即可跑起来,中小企业私有化部署的算力账第一次算得平。
值得注意的是 Qwen3.8-Flash-Next 的定位:它不是 Qwen4,但官方明说架构是 Qwen4 的雏形。这种「先放架构预演、再放正式旗舰」的节奏,给了下游(推理框架、Agent 工具链)提前适配的窗口期。
对开发者的影响
- Agent 工作流成本再降一档:长任务 Agent 动辄百万级 token 消耗,¥1/¥3 的价格让「让 Agent 多想几步」的边际成本变得可以忽略。
- 私有化部署更现实:开源权重 + FP8 量化 + SGLang/vLLM day-0 支持,自建推理服务的工程摩擦很小。
- 模型选型逻辑变化:按「激活参数量 × 价格」而非「总参数」评估模型,会成为新的比价习惯。
AI 之家 观点
Qwen3.8-Flash 真正的杀伤力不在榜单,而在成本结构:训练成本 -90% 意味着迭代可以更快,推理 ¥1/¥3 意味着应用层不再需要为「模型调用贵」设计复杂的降级策略。当模型能力溢出、价格触底,竞争重心会继续向工具层(AI 编程工具、Agent 平台)和上下文工程(Context Engineering)转移——这正是本站一直跟踪的主线。对个人开发者,建议把 Qwen3.8-Flash 纳入 Qwen Code / Cline 这类 BYOK 工具的备选模型池,实测长任务稳定性后再切换主力。
相关阅读
- Qwen3 模型详解 · Qwen3-Coder 模型详解
- Qwen Code CLI 工具卡 · Cline 工具卡
- DeepSeek V4 模型详解 · DeepSeek V4 发布资讯
- 智谱同日开源 GLM-5.3-Flash
来源
- 阿里千问 Qwen3.8-Flash 发布并开源(36氪快讯)
- 阿里通义 Qwen3.8-Flash 发布:125B 参数 MoE 模型,每 token 仅激活 6B(IT之家)
- qwen3.8-2.4t-a95b 模型信息(阿里云百炼帮助中心)
本资讯由 AI 之家 编辑部根据 36氪、IT之家及阿里云官方公开信息整理;性能与价格以官方最新口径为准。