跳到主内容
codingCognition

SWE-2

Cognition 于 2026 年 9 月 10 日发布的编程模型 SWE-2,基于月之暗面 Kimi K3(2.8T 参数)后训练而来。官方称 FrontierCode 1.1 Main 得 50.0%,距 Claude Fable 5.1 仅 1 分而成本低 64%;Terminal-Bench 2.1 达 92.8%,但 Terminal-Bench 4 仅 27.3%。仅在 Devin 产品线内提供,无开源权重、无独立 API。

发布 2026-09-23更新 2026-09-23核实 2026-09-23

规格

厂商
Cognition
发布日期
2026/9/10
类型
coding
定价
无独立 API / 无开源权重;随 Devin Desktop / CLI / Web / Fusion 订阅提供

基准测试

50.0%(Fable 5.1 50.9% / GPT-6 Astra 53.3% / SWE-1.7 42.0%)
FrontierCode 1.1 Main
73.0%(GPT-6 Astra 74.1% / GPT-5.6 Sol 72.7% / SWE-1.7 37.7%)
DeepSWE 1.1
92.8%(Fable 5.1 91.4% / GPT-6 Astra 89.9% / SWE-1.7 81.5%)
Terminal-Bench 2.1
27.3%(GPT-6 Astra 57.9% / Fable 5.1 55.8% / SWE-1.7 7.6%)
Terminal-Bench 4

优势

  • 性价比是当前卖点:FrontierCode 1.1 Main 50.0%,距 Claude Fable 5.1 的 50.9% 只差 1 分,官方称成本低 64%
  • Terminal-Bench 2.1 达 92.8%,官方表中为该基准最高分
  • 首个把 medium / high / max 三档推理强度在一次 RL run 里全部训成的模型,不用为档位单独训练
  • 轨迹明显变短:FrontierCode 上 medium 档比 SWE-1.7 少 58% 轮次、成本低 81%,平均步数 127 → 53
  • 首次把 RL 推到多万亿参数规模(基座 Kimi K3 为 2.8T 参数)

不足

  • Terminal-Bench 4 仅 27.3%,落后 GPT-6 Astra(57.9%)与 Claude Fable 5.1(55.8%)约 30 分,长程终端任务是明显短板
  • 无开源权重、无独立 API,只能在 Devin 产品线内使用,无法自建集成
  • 所有对比分数来自 Cognition 自家评测(FrontierCode 是 Cognition 自己的基准),非第三方独立复现
  • 不发布基座模型,生态复用性为零——你买的是 Devin 里的一个档位,不是一个可迁移的模型

适用场景

已在使用 Devin Desktop / CLI、想在不涨预算前提下提升单次任务成功率的团队按「每成功任务成本」核算的 agentic coding 流水线(medium 档尤其适合)需要可控推理强度分档的编码任务:简单改动走 medium,硬骨头切 max

概述

SWE-2 是 Cognition 在 2026 年 9 月 10 日发布的编程模型,官方定位是「把能力与成本的帕累托前沿往前推」。它的路线很特别:不训基座,只做后训练——基座是月之暗面的 Kimi K3(2.8T 参数,本身已做过大量 agentic coding 强化学习),Cognition 在其上再做一轮 RL。这与上一代 SWE-1.7 后训练自 Kimi K2.7 是同一打法,只是基座参数量接近 3 倍。

一句话判断:这不是一个「给你用的模型」,而是 Devin 产品线的一次单价下探。 它没有开源权重、没有独立 API,只随 Devin Desktop / CLI 提供(Devin Web 与 Fusion 逐步推送),所以评估它的正确单位不是「分数」,而是**「Devin 里跑成一个任务要花多少钱」**。

数值口径提醒:本文所有基准来自 Cognition 官方博客 自报,其中 FrontierCode 是 Cognition 自有基准,对手分数也出自 Cognition 的评测。目前尚无第三方独立复现(本站检索至 2026-09-23),请按「厂商自报区间」而非「榜单事实」使用。

核心能力

性价比:这张卡真正的卖点

在 FrontierCode 1.1 Main(考察「维护者会不会真的合并这个 PR」)上,SWE-2 拿到 50.0%,与 Claude Fable 5.1 的 50.9% 只差不到 1 分,官方称成本低 64%;相比 GPT-6 Astra 的 53.3% 落后几分,但价格约为其四分之一。

基准SWE-2Kimi K3Grok 4.6Fable 5.1GPT-5.6 SolGPT-6 AstraSWE-1.7
FrontierCode 1.1 Main50.0%44.2%48.0%50.9%47.5%53.3%42.0%
DeepSWE 1.173.0%68.5%67.5%67.4%72.7%74.1%37.7%
Terminal-Bench 2.192.8%88.3%88.4%91.4%88.8%89.9%81.5%
Terminal-Bench 427.3%21.5%20.3%55.8%37.3%57.9%7.6%

两张 Terminal-Bench 的落差是这张卡最该被盯住的地方:2.1 登顶、4.0 掉队。原因不难理解——2.1 任务偏短程、边界清晰,4.0 是重标定后的长程任务集(详见 Terminal-Bench)。别用 92.8% 去推断长程表现。

推理强度分档:一次 RL 训三档

SWE-2 是 Cognition 首个支持 medium / high / max 三档推理强度的模型,而且三档是同一次 RL 训练产出的——每个档位带一个线性成本惩罚项,惩罚系数按基座帕累托曲线的局部斜率设定,让等收益线与前沿相切,从而整条前沿一起外推,而不是单点优化。

官方同时给了「轨迹变短」的实测:

  • 平均步数:SWE-1.7 127 步 → SWE-2 medium 53 步(high 80、max 98);
  • 首次实质编辑:SWE-1.7 中位数 48 步 → SWE-2 medium 18 步
  • FrontierCode 上 medium 档比 SWE-1.7 少 58% 轮次、成本低 81%

针对 SWE-1.7 被吐槽的「简单任务也过度探索」,这一代主打 focused exploration。官方另总结三个行为特征:端到端测试覆盖更完整、工具被拦时更会绕路、结论被质疑时会重新推导而不是重复断言。

训练侧:首次把 RL 推到多万亿参数

除分档外,这轮训练还有几处工程变化:RL 环境数量增至三倍、加入指令遵循 overlay、用 SWE-2 自身 checkpoint 驱动 verifier 飞轮;rollout serving 侧改进调度并训练在线 draft model 提升解码吞吐,配合 NVFP4/FP8 kernel 与量化感知训练,在参数量近 3 倍的情况下仍把显存压下来、训练-推理失配低于 SWE-1.7。

获取方式与可用性

通道是否可用说明
开源权重自部署官方明确无开源权重
独立 API不存在,无法接入自家流水线
Devin Desktop发布日起可用
Devin CLI发布日起可用
Devin Web / Fusion⏳ 逐步推送官方称 rolling out

也就是说:你要用 SWE-2,就得用 Devin。这与 OpenAI Agents API 那种「把 harness 当 API 卖」的路线正好相反——Cognition 卖的是端到端席位,模型只是其中的成本变量。

适合 / 不适合

适合:

  • 已经在用 Devin Desktop / CLI 的团队——这是一次免费的能力与单价升级,切换成本为零
  • 按「每成功任务成本」而不是「模型分数」核算的 agentic coding 场景
  • 需要按难度分档控成本的场景:日常改动压到 medium,硬骨头再切 max

不适合:

  • 想自建集成、接自家 harness 的团队(无 API、无权重)
  • 长程终端自主任务为主的工作流——Terminal-Bench 4 的 27.3% 说明这块明显落后于 GPT-6 AstraClaude Fable 5.1
  • 需要第三方可复现基准做选型背书的采购流程(目前只有厂商自报数据)

相关阅读

来源

本卡片由 AI 之家 编辑部根据 Cognition 官方公开资料整理,非厂商付费内容。文中基准为厂商自报值,尚无第三方独立复现;如与最新官方信息不一致,欢迎通过 反馈邮箱 反馈。

相关工具

相关对比

Cursor vs Windsurf:AI IDE 两巨头怎么选?2026 对比

Cursor vs Windsurf 2026 选型对比:Composer 保守精细 vs Cascade 激进多文件,从 AI 能力、多模型、价格计费、企业版和适合人群判断,帮海外开发者选对 AI IDE 两巨头。两家都是 VS Code fork,但 Agent 设计哲学截然不同。

Devin vs Claude Code:AI 编程 Agent 怎么选?异步自主 vs 终端同步对比

Devin vs Claude Code 2026 选型对比:Cognition 异步自主 Cloud Agent vs Anthropic 终端同步 CLI Agent,从形态、工作模式、长任务能力、并发、价格、中文支持和适合人群 8 个维度判断,帮你选对 AI 编程 Agent。

Devin vs Manus:AI Agent 怎么选?2026 对比

Devin vs Manus 2026 选型对比:Cognition 出品的自主 AI 软件工程师 vs Butterfly Effect 的通用 AI Agent。从定位、核心能力、自主程度、价格、国内可用性和适用场景 6 个维度帮你选对 AI Agent。

Devin vs OpenHands:买托管服务还是自建开源平台?2026 对比

Devin 与 OpenHands 2026 选型对比:Devin 是开箱即用的云端 AI 软件工程师,按算力单位计费;OpenHands 是可自托管的开源 agent 平台,社区活跃。从产品形态、上手成本、长任务、国内可用性、计费与生态 6 个维度给出明确取舍。

Muse Code vs Devin:委托给云端还是留在终端里?2026 对比

Muse Code 与 Devin 2026 选型对比:Devin 是云端异步自主完成整包任务的 AI 软件工程师,价格高;Muse Code 主打终端原生与私有化多层部署。从产品形态、上手成本、长任务、国内可用性、计费与生态 6 个维度给出明确取舍。

Windsurf vs Trae:海外 AI IDE 与国产 AI IDE 怎么选(2026)

Windsurf 是海外 AI IDE 代表,Trae 是国产免费 AI IDE。一句话结论 + 决策树 + 价格对比:要前沿模型与 Agent 深度选 Windsurf,要国内直连与零成本起步选 Trae。