跳到主内容

JetBrains 发布 Mellum2.1:架构一点没改,靠数百万次沙箱强化学习把开源小模型训成了 agent 干活的料

JetBrains 于 2026-10-08 发布 Mellum2.1:架构沿用 12B MoE(2.5B 激活)与 Apache 2.0,改动全部在后训练——强化学习从「收尾环节」升级为训练主体,在数千个自建环境跑数百万次沙箱。官方称高负载下吞吐接近 Qwen3.5-9B 的两倍,单请求因多 token 预测快约 1.6 倍。

2026-10-10 · JetBrains 官方博客(2026-10-08,Bulat Salimzianov 署名,一手核对)

发布 2026-10-10核实 2026-10-10

要点速览

  • 架构完全没动,改的全是后训练:仍是 12B MoE / 2.5B 激活参数,仍是 Apache 2.0 许可。官方原话:「The architecture hasn't changed since version 2…What has changed is everything that happens after pre-training.」
  • 强化学习从「短期收尾环节」升级为训练主体:官方称团队用「一个夏天的真实环境强化学习」,在数千个环境里启动了数百万个沙盒。
  • 能力落点非常具体:能进仓库里干活——探索代码库、编辑文件、检查自己的修改;能定位失败测试的根因、起草修复并验证结果。官方承认 Mellum2 此前做不到这一点:「it couldn't work inside a repository at the level we wanted」。
  • 速度是它的主卖点:后训练没动架构,所以和 Mellum2 一样快;多 token 预测(MTP)让单请求快约 1.6 倍;高负载下是整组里最快的,服务 token 数接近 Qwen3.5-9B 的两倍。
  • 对照物是 Mellum2、Qwen3.5-9B 与 Gemma 4 E4B,官方声明所有模型用同一套评估设置。
  • 现在只有 Hugging Face 权重:面向 llama.cpp / Ollama / LM Studio 的 GGUF 版本,以及 vLLM 的 MTP(推测解码)头,官方均标注 coming soon——想本地跑起来的还得等。

它到底改了什么:把 RL 从收尾搬到主训

官方把改动归纳为三条,全部落在后训练:

① 强化学习换了个量级。 原文:「Reinforcement learning at a new scale: RL went from a short final stage to the main part of training.」——从「训练最后跑一小段」变成训练的主体。团队同时做了大量关于训练方法与数据的方法实验,只保留站得住的那些。

② 数据加得多,但筛得更狠。 新增了数学、竞赛编程、科学、工具使用、软件工程方向的 RL 任务,混合开放 RL 数据集与自建任务。关键在下一句——开放数据里常见问题很多:

Open data often comes with broken tests, unverifiable answers, or tasks that are too easy or impossible for the model, so every source was filtered before it reached training.

「坏掉的测试、无法验证的答案、过易或不可能完成的题目」——这三类正好是 RL 数据里最容易让 reward 信号失真的部分。先筛再训,这是官方明确写出来的做法。

③ 自建环境基建。 官方建了能在内部跑数千个 RL 环境的基础设施,整个训练期间启动了数百万个沙盒。

为什么这件事值得单独看一眼

它回应的是开源小模型最尴尬的那个缺口:能补全,但干不了活。

过去两年开源 coding 模型的评测分数一路在涨,但真把它塞进 agent 循环里,常见失败模式不是「写不出代码」,而是**「改完之后不知道自己改坏了什么」——缺乏在仓库里迭代、自检、回滚**的能力。JetBrains 这次把训练目标直接对准这条:探索代码库 → 编辑文件 → 检查自己的修改,并把「定位失败测试根因 → 起草修复 → 验证结果」写成明确的能力项。

这条路线的成本也很直白:数百万次沙箱不是小数目。对小团队来说,真正可复用的不是这个规模,而是它的筛选纪律——先过滤开放 RL 数据里的坏测试与不可验证答案,再进训练。

性能:官方给了什么,没给什么

官方在正文里给出的可转录结论只有三条:

维度官方表述
与 Mellum2 的速度对比一样快(后训练未动架构)
单请求多 token 预测(MTP)使其快约 1.6 倍
高负载吞吐组内最快,服务 token 数接近 Qwen3.5-9B 的两倍
全面提升的维度编程、竞赛编程、数学、工具调用、通用知识(agentic coding 提升最大)

本站不转录图中数字:官方正文未列出各基准的具体分数,评测结果以图片形式发布(官方博客内嵌图表轮播)。本站未逐图读数,也不从第三方转载里转抄数字——需要具体分数的请直接看官方博客原图。这一点同时列入下方「待核实」。

另外要注意对照组的口径:官方只说与 Mellum2、Qwen3.5-9B、Gemma 4 E4B 在相同评估设置下比较,未给出具体的 harness、采样参数与快照日期。

部署现状:权重有了,本地跑还得等

渠道状态
Hugging Face 权重已上线(官方给出 Mellum2.1 collection)
GGUF(llama.cpp / Ollama / LM Studio)⏳ coming soon
MTP 头(vLLM 推测解码)⏳ coming soon

这意味着什么:如果你今天是 Ollama / LM Studio 用户,官方渠道还装不上;要走 vLLM 拿 MTP 加速也还要等那个头。反过来说,「高负载吞吐接近 Qwen3.5-9B 两倍」这条结论是在有 MTP 的前提下给出的,等真正的 GGUF 落地后本地实测是否与官方口径一致,本站尚未验证。

官方给的三个典型用途:① 作为 agent 系统里干活的工人(从定位失败测试根因到起草并验证修复);② 超出编程的通用助手(日常问题、硬数学与推理的分步求解);③ 私有自托管部署(代码与数据完全留在自己手里)。

AI 之家 观点

这条新闻的价值在「路线」,不在「分数」。

2026 年开源 coding 模型的竞争已经明显分成两条路:一条是继续堆参数与上下文,另一条是在固定架构上把后训练做深。Mellum2.1 是后者的典型样本——架构一行没改,12B MoE / 2.5B 激活照旧,Apache 2.0 照旧,靠 RL 主训 + 数百万沙箱换了能力曲线。对本地部署用户的现实意义更大:2.5B 激活参数意味着它不是「买得起显卡才跑得动」的模型,而是真正能塞进单机、塞进 agent 循环里当子 agent 用的那一档。

但要泼两盆冷水。

第一,官方没给分数。 正文里所有性能结论都是相对表述(「快约 1.6 倍」「接近两倍」「提升最大」),具体基准数字只在图里。任何转载该文并列出具体分数表的内容,都不来自官方正文——本站选择不转抄。

第二,对中文项目要谨慎。 官方的能力清单与评测维度(竞赛编程、数学、科学、工具使用、软件工程)未涉及中文语境,也未声明中文代码注释 / 中文需求描述的处理能力。国内团队把它接进 agent 前,建议先用自己的仓库做一轮小规模对照,不要按英文基准的外推结论直接上线。

顺带一提:本站目前没有 Mellum 的模型卡也没有 JetBrains 工具卡,因此本文未做站内模型内链——需要一张 Mellum 资料卡的读者,可把需求反馈给我们,我们会在补齐配套素材后考虑建卡。

待核实

  • 各基准的具体分数:官方仅以图片发布,正文未列出数字;本站未转录,也未从第三方转载转抄。
  • 评测的 harness / 采样参数 / 快照日期:官方仅声明「same evaluation setup for all of them」,未给细节。
  • GGUF 与 vLLM MTP 头的确切上线时间:官方只写 coming soon。
  • 中文代码与中文需求场景下的表现:官方未涉及,本站未实测。
  • 上下文窗口长度:官方发布公告未提及 context window 参数(第三方转载亦未给一致口径),本站不填。
  • 是否会有 JetBrains IDE 内的直接集成形态:官方公告只谈模型发布与自托管,未提 IDE 集成计划。

来源

口径说明:本文事实部分逐段核对 JetBrains 官方博客原文;发布日期 2026-10-08 取自该公告标注,非推断。凡官方正文未给出的数字,本站一律留空并列入待核实,不做转抄。

相关对比

Aider vs OpenCode:两个开源终端 Agent,选哪个?2026 对比

Aider 与 OpenCode 2026 选型对比:两者都是开源终端 agent、都支持换模型,但 Aider 以 Git-native 工作流与成熟的多语言支持见长,OpenCode 主打模型无关、本地优先与终端交互体验。从 6 个维度给出明确取舍建议。

OpenCode vs Claude Code:终端 AI Coding Agent 怎么选?开源平替 vs 官方 CLI 对比

OpenCode vs Claude Code 2026 选型对比:SST 开源 MIT CLI Agent(75+ 模型 BYOK)vs Anthropic 官方闭源 CLI Agent(Claude 长任务第一梯队),从形态、模型自由、长任务、TUI 体验、多会话、MCP、价格、国内门槛和适合人群 9 个维度判断,帮你选对终端 AI Coding Agent。

LM Studio vs Msty:本地大模型桌面工具怎么选?2026 对比

LM Studio vs Msty 2026 选型对比:模型浏览器 + OpenAI 兼容 API 的本地推理工具 vs 多模型并行 + Knowledge Stack 的桌面 AI 工作站。从定位、易用性、模型发现、API 服务、价格和适合人群 6 个维度帮你选对本地 LLM 桌面工具。

Ollama vs LM Studio:本地跑大模型,命令行派 vs 图形派(2026 选型)

Ollama 和 LM Studio 都能在本机跑开源大模型。一句话结论 + 决策树 + 成本对比:要命令行、要被其他工具调用选 Ollama,要图形界面、要可视化调参选 LM Studio。

Msty vs Ollama:本地大模型怎么跑?2026 对比

Msty vs Ollama 2026 选型对比:精品桌面 GUI 工作站 vs 本地 LLM Daemon 事实标准。从定位、易用性、模型管理、功能、价格、适用人群 6 个维度帮你选对本地大模型方案。

vLLM vs Ollama:本地推理引擎与本地模型运行时怎么选(2026)

vLLM 是高吞吐推理引擎,Ollama 是开箱即用的本地模型运行时。一句话结论 + 决策树 + 成本对比:要生产级吞吐与并发选 vLLM,要个人本地快速跑起来选 Ollama。