跳到主内容

K2 Horizon 375B 开源舰队:可复现性成为前沿 AI 的卖点

2026-09-11 · AI 之家编辑部(综合 RuntimeWire、HuggingNews 对 MBZUAI/IFM K2 Horizon 的报道,2026-09-03)

要点

  • 六档舰队(9-3):MBZUAI 旗下 IFM(Eric Xing)一次放出 K2 Horizon 0.9B / 3.7B / 7B / 32B / 36B-A4B / 375B-A23B,覆盖手表、手机、工作站到企业服务器;被称为「AI 史上最大全开源发布」。
  • 不只是权重:同步放出训练代码、在许可范围内的数据配方、中间检查点、配置、训练日志、评测结果与训练后产物——把可复现性做成特性而非模型卡里的一句承诺。
  • 旗舰 375B-A23B:MoE、23B 激活、512K 上下文;AA Intelligence Index 47 分(较上代 70B K2 Think V2 大幅提升);在 AA-Omniscience 上靠「拒答 60%」把幻觉率从 71% 压到 26%。
  • 36B-A4B 引入 MoVA:混合价值注意力(Mixture-of-Value Attention),把专家路由同时融进多头注意力与前馈层,兼容 FlashAttention / GQA / 稀疏注意力。
  • 务实档位:自托管真正能跑的是 32B(原生 524K 上下文)与 36B-A4B;375B 仍是多节点集群级。

本文为 AI 之家 基于 RuntimeWire 与 HuggingNews 对 K2 Horizon 的报道整合。

一、把「可复现」做成前沿 AI 的特性

2026-09-03,Eric Xing 的 MBZUAI 旗下 Institute of Foundation Models(IFM)发布 K2 Horizon 六档语言模型,权重、代码与训练材料一并放出,意图展示它们是怎么造出来的。这是 Xing 的一次表态:让可复现性成为前沿 AI 的feature,而非埋在模型卡里的承诺。

舰队从 0.9B 到 375B:

档位架构部署目标
0.9B稠密手表、超低端设备
3.7B / 7B稠密手机、本地工作站
32B稠密本地工作站、企业服务器(原生 524K 上下文)
36B-A4B稀疏 MoE(MoVA)每 token 激活约 4B
375B-A23B旗舰 MoE每 token 激活约 23B,企业/集群

IFM 称开源不该只有权重:外部应能检查数据、方法与结果,复现并改进。它发布了在许可范围内可再分发的数据配方、受限再分发只能给构造配方、中间检查点、配置、训练日志、评测结果与训练后产物。

二、旗舰 375B:参数与上下文进入闭源领地

旗舰 K2 Horizon 375B 用 MoE 架构,23B 激活参数、512K token 上下文窗口,在 Artificial Analysis Intelligence Index 拿到 47 分——较上代 70B 的 K2 Think V2 大幅提升。更小的 36B-A4B 引入 MoVA(Mixture-of-Value Attention),把专家路由同时融进多头注意力与前馈层,IFM 称其在 FlashAttention、分组查询注意力(GQA)与稀疏注意力下仍兼容。

效率侧有两个 IFM 自报、尚待外部审计的claim:

  • 36B-A4B 在同等训练条件下仅略低于其稠密 32B 兄弟,却每 token 激活更少参数
  • Uno 适配器(0.9B / 7B)带来约 3 倍生成加速且不降输出质量。

预训练约 20T token(约 10T 合成),其中近 17% 是带显式推理的问题求解轨迹。Hugging Face 上的 K2 Horizon 集合已含六档仓库、量化变体与多个大数据集,Day-0 即获 SGLang 支持。

三、幻觉治理:靠「多拒答」换准确率

375B 在 AA-Omniscience 基准上把幻觉率从 71% 降到 26%,代价是对 60% 的问题选择拒答。这是一种明确的权衡:用「知道何时不知道」换可信度。对工程团队,这意味着评测要看「拒答率 + 在答区间的准确率」两条线,而不是单一准确率。

AI 之家 观点

K2 Horizon 的意义不在某个榜单分数,而在它把训练全生命周期的溯源摆上台面——代码、数据配方、检查点、日志、评测一并开源。这恰好与 8 月底到 9 月初的 GLM-5.3 / Qwen3.8 / 腾讯 Hy4 开源权重潮 形成对照:那一波比的是「参数与上下文到哪了」,这一波比的是「我能不能让你复现」。

对自托管团队的三条判断:

  1. 务实档位是 32B 与 36B-A4B:375B 仍是集群级,32B 原生 524K、36B-A4B 用 MoVA 压激活参数,是真正能落地的两档;
  2. 把可复现当选型维度:同样 Apache 2.0 / MIT 的权重,谁能给检查点与训练日志,谁就更适合做长期依赖(参见 BYOK 模型池对照);
  3. 评测看拒答率:前沿开源模型普遍用「多拒答」换可信度,单看准确率会被误导。

相关阅读

来源

本文由 AI 之家 编辑部根据公开报道整合;各效率 claim 以 IFM 自报评测为准,独立审计结果以对应官方口径更新。