Cognition 发布 SWE-2:Kimi K3 后训练而来,FrontierCode 50.0% 逼近 Fable 5.1,同分便宜 64%
2026-09-14 · Cognition 官方博客 / byteiota / TechPillow
要点
- SWE-2 于 2026-09-10 发布,即日登陆 Devin Desktop 与 Devin CLI,Devin Web 与 Fusion 分批推送。
- 后训练基座是 Kimi K3(月之暗面,2.8T 参数 MoE)。Cognition 称在此基础上再找到 5–6 分的提升空间。
- FrontierCode 1.1 Main 50.0%,距 Claude Fable 5.1(50.9%)不到 1 分,官方称同等成绩下成本低 64%。
- Terminal-Bench 2.1 92.8%,高于 Fable 5.1(91.4%)与 GPT-6 Astra(89.9%);相比上代 SWE-1.7 的 81.5% 是大幅跃升。
- 明显短板:Terminal-Bench 4 仅 27.3%,Fable 5.1 为 55.8%、GPT-6 Astra 为 57.9%,差距近 28 个百分点。
- 效率改善是这次的主线:SWE-2 medium 相比 SWE-1.7 少 58% 的交互轮次、平均成本降 81%;首次真实代码编辑的中位步数从 48 步降到 18 步。
- 三档 effort(medium / high / max)在一次 RL 训练中同时训出,靠「按各档局部斜率调参的线性成本惩罚」推进整条帕累托前沿。
- 限制:无独立 API、无开源权重、无 model card,只能走 Devin 产品线;Devin 仍按 ACU 计费,推理变便宜不等于账单变便宜。
背景与分析
Cognition 的叙事从 SWE-1.7 起就没变过:不追单张榜单的冠军,而是优化整条「成本—性能」帕累托曲线。SWE-2 把这条路线推到了多万亿参数规模——这是官方强调的第一次。
训练方法上值得记的有三处:
- 帕累托感知的成本惩罚:每个 effort 档配一个线性成本惩罚,系数按基座模型帕累托前沿的局部斜率调,目标是把整条前沿往外推而不改变它的形状。
- 长度加权 reward baseline(自 SWE-1.6 沿用):官方称显著稳定了训练。
- rollout serving 优化:NVFP4/FP8 kernel + 量化感知训练,在基座参数量接近 3 倍的情况下,仍拿到与 SWE-1.7 相近的吞吐和更低的训练—推理失配。
行为层面的变化比分数更有意思。官方给出的数据:SWE-2 medium 平均 53 步完成 FrontierCode 任务,SWE-1.7 是 127 步;而且 SWE-1.7 被吐槽的「过度探索」在 SWE-2 上明显缓解——模型能判断代码库里哪部分才和当前任务有关。
再叠加一条资本侧的背景:Cognition 于 9 月 8 日宣布完成超 20 亿美元 E 轮融资,估值 480 亿美元(a16z 与 Accel 领投),公司称年化收入从 5 月的 4.92 亿美元增至近 9 亿美元。自研模型替代 Anthropic / OpenAI 的零售价,是它把 $20 档 Devin Pro 做成生意的前提。
对开发者的影响
- 短、边界清晰的任务是甜区。Terminal-Bench 2.1 的 92.8% 与「18 步就动手改」说明,SWE-2 很适合 PR 审查、小功能实现、明确 bug 修复这类高频活。
- 长程自主任务别指望它。Terminal-Bench 4 的 27.3% 是硬数据——需要连续数小时自主推进的大型仓库重构,仍应挂 Fable 5.1 或 GPT-6 Astra 级别的前沿模型。
- 没有 API 就是没有 API。想把它接进自研 harness、CI/CD 或 OpenRouter 的团队,目前只能等;社区里最尖锐的抱怨也是这句「我不想用你们的 CLI,我已有自己的 harness」。
- 账单不要直接换算。Devin 仍按 ACU 计费,官方公布的每一个「便宜 64%」都是竞品价格口径,不是你的发票口径。第三方报道称 Devin Pro / Max / Teams 订阅可免费用一个月 SWE-2——建议拿这一个月在固定工单集上跑自己的对比,再决定续不续。
AI 之家 观点
SWE-2 的真正信号不在分数,而在**「前沿实验室的下游厂商开始用开源中国模型做基座,自己只卖后训练与 harness」**。
- 价值重心从基座模型移到了后训练 + 产品形态。Kimi K3 开源权重摆在那里,Cognition 加的那 5–6 分和 64% 的成本优化才是它卖钱的部分。这条路径对国内做 Agent 产品的团队是可复制的模板。
- 「成本—性能帕累托前沿」正在取代「最强模型」成为叙事单位。SWE-2 的发布稿里,effort 档与成本惩罚的篇幅比基准表还多——因为对企业采购来说,能在同一模型上买三档成本,比拿到一个冠军分数有用得多。
- 基准挑选必须自己复核。Cognition 领跑的 FrontierCode 是自家的榜,且它没有在发布稿里突出 Terminal-Bench 4。AI 之家 的判断是:把 SWE-2 用在「单 PR 级别」的活上,性价比是真的;把它当成能过夜跑大重构的自主工程师,会翻车。
选型建议:已有 Devin 订阅的团队,用免费月做一轮 scoped tickets 的 A/B;Claude Code / Codex 用户不必因为这条新闻迁移,但对「每任务成本」敏感的团队,值得把 SWE-2 的中等 effort 档纳入比价。
相关阅读
- 工具卡:Devin · Claude Code · Codex CLI · Cursor
- 模型卡:Kimi K3 · Claude Fable 5.1 · GPT-6 Astra · DeepSeek V4
- 对比页:Devin vs Claude Code
- 相关资讯:AI 编程工具周报 2026-09-13 · Kimi K3 发布
- 概念:Agentic Coding · SWE-bench