跳到主内容

Cognition 发布 SWE-2:Kimi K3 后训练而来,FrontierCode 50.0% 逼近 Fable 5.1,同分便宜 64%

2026-09-14 · Cognition 官方博客 / byteiota / TechPillow

要点

  • SWE-2 于 2026-09-10 发布,即日登陆 Devin Desktop 与 Devin CLI,Devin Web 与 Fusion 分批推送。
  • 后训练基座是 Kimi K3(月之暗面,2.8T 参数 MoE)。Cognition 称在此基础上再找到 5–6 分的提升空间。
  • FrontierCode 1.1 Main 50.0%,距 Claude Fable 5.1(50.9%)不到 1 分,官方称同等成绩下成本低 64%
  • Terminal-Bench 2.1 92.8%,高于 Fable 5.1(91.4%)与 GPT-6 Astra(89.9%);相比上代 SWE-1.7 的 81.5% 是大幅跃升。
  • 明显短板:Terminal-Bench 4 仅 27.3%,Fable 5.1 为 55.8%、GPT-6 Astra 为 57.9%,差距近 28 个百分点。
  • 效率改善是这次的主线:SWE-2 medium 相比 SWE-1.7 少 58% 的交互轮次、平均成本降 81%;首次真实代码编辑的中位步数从 48 步降到 18 步
  • 三档 effort(medium / high / max)在一次 RL 训练中同时训出,靠「按各档局部斜率调参的线性成本惩罚」推进整条帕累托前沿。
  • 限制:无独立 API、无开源权重、无 model card,只能走 Devin 产品线;Devin 仍按 ACU 计费,推理变便宜不等于账单变便宜。

背景与分析

Cognition 的叙事从 SWE-1.7 起就没变过:不追单张榜单的冠军,而是优化整条「成本—性能」帕累托曲线。SWE-2 把这条路线推到了多万亿参数规模——这是官方强调的第一次。

训练方法上值得记的有三处:

  1. 帕累托感知的成本惩罚:每个 effort 档配一个线性成本惩罚,系数按基座模型帕累托前沿的局部斜率调,目标是把整条前沿往外推而不改变它的形状
  2. 长度加权 reward baseline(自 SWE-1.6 沿用):官方称显著稳定了训练。
  3. rollout serving 优化:NVFP4/FP8 kernel + 量化感知训练,在基座参数量接近 3 倍的情况下,仍拿到与 SWE-1.7 相近的吞吐和更低的训练—推理失配。

行为层面的变化比分数更有意思。官方给出的数据:SWE-2 medium 平均 53 步完成 FrontierCode 任务,SWE-1.7 是 127 步;而且 SWE-1.7 被吐槽的「过度探索」在 SWE-2 上明显缓解——模型能判断代码库里哪部分才和当前任务有关。

再叠加一条资本侧的背景:Cognition 于 9 月 8 日宣布完成超 20 亿美元 E 轮融资,估值 480 亿美元(a16z 与 Accel 领投),公司称年化收入从 5 月的 4.92 亿美元增至近 9 亿美元。自研模型替代 Anthropic / OpenAI 的零售价,是它把 $20 档 Devin Pro 做成生意的前提。

对开发者的影响

  • 短、边界清晰的任务是甜区。Terminal-Bench 2.1 的 92.8% 与「18 步就动手改」说明,SWE-2 很适合 PR 审查、小功能实现、明确 bug 修复这类高频活。
  • 长程自主任务别指望它。Terminal-Bench 4 的 27.3% 是硬数据——需要连续数小时自主推进的大型仓库重构,仍应挂 Fable 5.1 或 GPT-6 Astra 级别的前沿模型。
  • 没有 API 就是没有 API。想把它接进自研 harness、CI/CD 或 OpenRouter 的团队,目前只能等;社区里最尖锐的抱怨也是这句「我不想用你们的 CLI,我已有自己的 harness」。
  • 账单不要直接换算。Devin 仍按 ACU 计费,官方公布的每一个「便宜 64%」都是竞品价格口径,不是你的发票口径。第三方报道称 Devin Pro / Max / Teams 订阅可免费用一个月 SWE-2——建议拿这一个月在固定工单集上跑自己的对比,再决定续不续

AI 之家 观点

SWE-2 的真正信号不在分数,而在**「前沿实验室的下游厂商开始用开源中国模型做基座,自己只卖后训练与 harness」**。

  1. 价值重心从基座模型移到了后训练 + 产品形态。Kimi K3 开源权重摆在那里,Cognition 加的那 5–6 分和 64% 的成本优化才是它卖钱的部分。这条路径对国内做 Agent 产品的团队是可复制的模板。
  2. 「成本—性能帕累托前沿」正在取代「最强模型」成为叙事单位。SWE-2 的发布稿里,effort 档与成本惩罚的篇幅比基准表还多——因为对企业采购来说,能在同一模型上买三档成本,比拿到一个冠军分数有用得多
  3. 基准挑选必须自己复核。Cognition 领跑的 FrontierCode 是自家的榜,且它没有在发布稿里突出 Terminal-Bench 4。AI 之家 的判断是:把 SWE-2 用在「单 PR 级别」的活上,性价比是真的;把它当成能过夜跑大重构的自主工程师,会翻车。

选型建议:已有 Devin 订阅的团队,用免费月做一轮 scoped tickets 的 A/B;Claude Code / Codex 用户不必因为这条新闻迁移,但对「每任务成本」敏感的团队,值得把 SWE-2 的中等 effort 档纳入比价。

相关阅读

来源

相关对比

Aider vs Claude Code:终端 AI 编程双雄怎么选

Aider vs Claude Code 2026 选型对比:开源 BYOK 多模型 vs Anthropic 订阅长任务 Agent,从编程能力、多模型支持、价格、Git 集成、国内可用性和适合人群判断,帮你选对终端 AI 编程工具。

Augment Code vs Cursor:企业 AI 编程怎么选?Context Engine vs AI IDE 对比

Augment Code vs Cursor 2026 选型对比:Context Engine 全仓索引的企业 AI 平台 vs SpaceX 收购的 AI IDE 天花板,从形态、Context 覆盖、长任务、价格、合规、中文支持和适合人群 8 个维度判断,帮你选对企业 AI 编程工具。

Claude Code vs Cline:CLI AI Agent 怎么选?2026 对比

Claude Code vs Cline 2026 选型对比:Anthropic 官方闭源 CLI Agent vs Apache-2.0 开源 VS Code 插件。从模型绑定、工作流、MCP 支持、价格、隐私和适合人群 6 个维度帮你选对 CLI AI 编程工具。

Claude Code vs Codex CLI:终端 AI Agent 双雄对比

Claude Code vs Codex CLI 2026 选型对比:Anthropic 与 OpenAI 两大官方终端 Agent 的模型、长任务、MCP 生态、Windows 支持、订阅打包价格和国内可用性全方位对比,帮你判断该用哪个终端 AI Agent,以及能不能两个一起用。

Claude Code vs Crush:Anthropic 官方 vs 多模型 TUI(2026 实测选型)

Claude Code vs Crush 2026 选型对比:Anthropic 官方 CLI Agent(Claude only + 长任务最稳 + MCP 一等公民)vs Charmbracelet 开源 TUI Agent(多模型 mid-session 切换 + LSP + FSL-1.1-MIT)。从模型、长任务、生态、价格、国内可用性帮你选对终端 AI 编程工具。

Claude Code vs Gemini CLI:终端 AI Agent 怎么选?(2026 选型指南)

Claude Code 和 Gemini CLI 都是终端原生的 AI 编码 Agent。一句话结论 + 决策树 + 价格 + 国内可用性对比:长任务与 CLAUDE.md 生态选前者,免费额度与接入门槛选后者。

相关评测