SWE-2
Cognition 于 2026 年 9 月 10 日发布的编程模型 SWE-2,基于月之暗面 Kimi K3(2.8T 参数)后训练而来。官方称 FrontierCode 1.1 Main 得 50.0%,距 Claude Fable 5.1 仅 1 分而成本低 64%;Terminal-Bench 2.1 达 92.8%,但 Terminal-Bench 4 仅 27.3%。仅在 Devin 产品线内提供,无开源权重、无独立 API。
发布 2026-09-23更新 2026-09-23核实 2026-09-23规格
- 厂商
- Cognition
- 发布日期
- 2026/9/10
- 类型
- coding
- 定价
- 无独立 API / 无开源权重;随 Devin Desktop / CLI / Web / Fusion 订阅提供
基准测试
优势
- •性价比是当前卖点:FrontierCode 1.1 Main 50.0%,距 Claude Fable 5.1 的 50.9% 只差 1 分,官方称成本低 64%
- •Terminal-Bench 2.1 达 92.8%,官方表中为该基准最高分
- •首个把 medium / high / max 三档推理强度在一次 RL run 里全部训成的模型,不用为档位单独训练
- •轨迹明显变短:FrontierCode 上 medium 档比 SWE-1.7 少 58% 轮次、成本低 81%,平均步数 127 → 53
- •首次把 RL 推到多万亿参数规模(基座 Kimi K3 为 2.8T 参数)
不足
- •Terminal-Bench 4 仅 27.3%,落后 GPT-6 Astra(57.9%)与 Claude Fable 5.1(55.8%)约 30 分,长程终端任务是明显短板
- •无开源权重、无独立 API,只能在 Devin 产品线内使用,无法自建集成
- •所有对比分数来自 Cognition 自家评测(FrontierCode 是 Cognition 自己的基准),非第三方独立复现
- •不发布基座模型,生态复用性为零——你买的是 Devin 里的一个档位,不是一个可迁移的模型
适用场景
概述
SWE-2 是 Cognition 在 2026 年 9 月 10 日发布的编程模型,官方定位是「把能力与成本的帕累托前沿往前推」。它的路线很特别:不训基座,只做后训练——基座是月之暗面的 Kimi K3(2.8T 参数,本身已做过大量 agentic coding 强化学习),Cognition 在其上再做一轮 RL。这与上一代 SWE-1.7 后训练自 Kimi K2.7 是同一打法,只是基座参数量接近 3 倍。
一句话判断:这不是一个「给你用的模型」,而是 Devin 产品线的一次单价下探。 它没有开源权重、没有独立 API,只随 Devin Desktop / CLI 提供(Devin Web 与 Fusion 逐步推送),所以评估它的正确单位不是「分数」,而是**「Devin 里跑成一个任务要花多少钱」**。
数值口径提醒:本文所有基准来自 Cognition 官方博客 自报,其中 FrontierCode 是 Cognition 自有基准,对手分数也出自 Cognition 的评测。目前尚无第三方独立复现(本站检索至 2026-09-23),请按「厂商自报区间」而非「榜单事实」使用。
核心能力
性价比:这张卡真正的卖点
在 FrontierCode 1.1 Main(考察「维护者会不会真的合并这个 PR」)上,SWE-2 拿到 50.0%,与 Claude Fable 5.1 的 50.9% 只差不到 1 分,官方称成本低 64%;相比 GPT-6 Astra 的 53.3% 落后几分,但价格约为其四分之一。
| 基准 | SWE-2 | Kimi K3 | Grok 4.6 | Fable 5.1 | GPT-5.6 Sol | GPT-6 Astra | SWE-1.7 |
|---|---|---|---|---|---|---|---|
| FrontierCode 1.1 Main | 50.0% | 44.2% | 48.0% | 50.9% | 47.5% | 53.3% | 42.0% |
| DeepSWE 1.1 | 73.0% | 68.5% | 67.5% | 67.4% | 72.7% | 74.1% | 37.7% |
| Terminal-Bench 2.1 | 92.8% | 88.3% | 88.4% | 91.4% | 88.8% | 89.9% | 81.5% |
| Terminal-Bench 4 | 27.3% | 21.5% | 20.3% | 55.8% | 37.3% | 57.9% | 7.6% |
两张 Terminal-Bench 的落差是这张卡最该被盯住的地方:2.1 登顶、4.0 掉队。原因不难理解——2.1 任务偏短程、边界清晰,4.0 是重标定后的长程任务集(详见 Terminal-Bench)。别用 92.8% 去推断长程表现。
推理强度分档:一次 RL 训三档
SWE-2 是 Cognition 首个支持 medium / high / max 三档推理强度的模型,而且三档是同一次 RL 训练产出的——每个档位带一个线性成本惩罚项,惩罚系数按基座帕累托曲线的局部斜率设定,让等收益线与前沿相切,从而整条前沿一起外推,而不是单点优化。
官方同时给了「轨迹变短」的实测:
- 平均步数:SWE-1.7 127 步 → SWE-2 medium 53 步(high 80、max 98);
- 首次实质编辑:SWE-1.7 中位数 48 步 → SWE-2 medium 18 步;
- FrontierCode 上 medium 档比 SWE-1.7 少 58% 轮次、成本低 81%。
针对 SWE-1.7 被吐槽的「简单任务也过度探索」,这一代主打 focused exploration。官方另总结三个行为特征:端到端测试覆盖更完整、工具被拦时更会绕路、结论被质疑时会重新推导而不是重复断言。
训练侧:首次把 RL 推到多万亿参数
除分档外,这轮训练还有几处工程变化:RL 环境数量增至三倍、加入指令遵循 overlay、用 SWE-2 自身 checkpoint 驱动 verifier 飞轮;rollout serving 侧改进调度并训练在线 draft model 提升解码吞吐,配合 NVFP4/FP8 kernel 与量化感知训练,在参数量近 3 倍的情况下仍把显存压下来、训练-推理失配低于 SWE-1.7。
获取方式与可用性
| 通道 | 是否可用 | 说明 |
|---|---|---|
| 开源权重自部署 | 官方明确无开源权重 | |
| 独立 API | 不存在,无法接入自家流水线 | |
| Devin Desktop | 发布日起可用 | |
| Devin CLI | 发布日起可用 | |
| Devin Web / Fusion | ⏳ 逐步推送 | 官方称 rolling out |
也就是说:你要用 SWE-2,就得用 Devin。这与 OpenAI Agents API 那种「把 harness 当 API 卖」的路线正好相反——Cognition 卖的是端到端席位,模型只是其中的成本变量。
适合 / 不适合
适合:
- 已经在用 Devin Desktop / CLI 的团队——这是一次免费的能力与单价升级,切换成本为零
- 按「每成功任务成本」而不是「模型分数」核算的 agentic coding 场景
- 需要按难度分档控成本的场景:日常改动压到 medium,硬骨头再切 max
不适合:
- 想自建集成、接自家 harness 的团队(无 API、无权重)
- 长程终端自主任务为主的工作流——Terminal-Bench 4 的 27.3% 说明这块明显落后于 GPT-6 Astra 与 Claude Fable 5.1
- 需要第三方可复现基准做选型背书的采购流程(目前只有厂商自报数据)
相关阅读
- 承载产品:Devin 工具卡
- 基座模型:Kimi K3
- 同档对比:Claude Fable 5.1 / GPT-6 Astra / GPT-5.6
- 相关资讯:Windsurf 更名 Devin Desktop
- 概念:Terminal-Bench 怎么读 / 智能体编程
来源
- Introducing SWE-2: Pushing the Pareto Frontier(Cognition 官方博客,一手来源)
- Terminal-Bench 官方榜单与 4.0 说明(用于核对 2.1 与 4.0 难度差异)
本卡片由 AI 之家 编辑部根据 Cognition 官方公开资料整理,非厂商付费内容。文中基准为厂商自报值,尚无第三方独立复现;如与最新官方信息不一致,欢迎通过 反馈邮箱 反馈。
Cursor vs Windsurf:AI IDE 两巨头怎么选?2026 对比
Cursor vs Windsurf 2026 选型对比:Composer 保守精细 vs Cascade 激进多文件,从 AI 能力、多模型、价格计费、企业版和适合人群判断,帮海外开发者选对 AI IDE 两巨头。两家都是 VS Code fork,但 Agent 设计哲学截然不同。
Devin vs Claude Code:AI 编程 Agent 怎么选?异步自主 vs 终端同步对比
Devin vs Claude Code 2026 选型对比:Cognition 异步自主 Cloud Agent vs Anthropic 终端同步 CLI Agent,从形态、工作模式、长任务能力、并发、价格、中文支持和适合人群 8 个维度判断,帮你选对 AI 编程 Agent。
Devin vs Manus:AI Agent 怎么选?2026 对比
Devin vs Manus 2026 选型对比:Cognition 出品的自主 AI 软件工程师 vs Butterfly Effect 的通用 AI Agent。从定位、核心能力、自主程度、价格、国内可用性和适用场景 6 个维度帮你选对 AI Agent。
Devin vs OpenHands:买托管服务还是自建开源平台?2026 对比
Devin 与 OpenHands 2026 选型对比:Devin 是开箱即用的云端 AI 软件工程师,按算力单位计费;OpenHands 是可自托管的开源 agent 平台,社区活跃。从产品形态、上手成本、长任务、国内可用性、计费与生态 6 个维度给出明确取舍。
Muse Code vs Devin:委托给云端还是留在终端里?2026 对比
Muse Code 与 Devin 2026 选型对比:Devin 是云端异步自主完成整包任务的 AI 软件工程师,价格高;Muse Code 主打终端原生与私有化多层部署。从产品形态、上手成本、长任务、国内可用性、计费与生态 6 个维度给出明确取舍。
Windsurf vs Trae:海外 AI IDE 与国产 AI IDE 怎么选(2026)
Windsurf 是海外 AI IDE 代表,Trae 是国产免费 AI IDE。一句话结论 + 决策树 + 价格对比:要前沿模型与 Agent 深度选 Windsurf,要国内直连与零成本起步选 Trae。