跳到主内容

Real-SWE:把最强编码 Agent 丢进真实企业私有代码库,Claude Fable 5.1 只拿到 38.8%

2026-09-19 · Specific Labs Real-SWE / THE DAILY BRIEF (beri.net) / World Programming / DEV Community / AI Miner / Eli's Tech & AI Weekly

要点

榜单(模型 + 其配套 harness,每个任务 8 次尝试)

排名模型 / Harness解决率单次 rollout 成本每解决一任务成本
1Claude Fable 5.1 / Claude Code38.8%$6.96$17.94
2GPT-6 Astra / Codex CLI33.8%$4.67$13.82
3Gemini 3.8 Flash / Gemini CLI31.2%$2.50$8.01
4GLM 5.3 / Claude Code28.8%$5.12$17.78
5Grok 4.6 / Grok Build23.8%$3.44$14.45
5Muse Spark 1.3 / Muse Code23.8%$2.74$11.51
7Kimi K3 / Kimi Code18.8%$3.90$20.74
8GPT-5.6 Sol / Codex CLI16.2%$2.65$16.36

前四列来自 Real-SWE 榜单,「每解决一任务成本」= 单次成本 ÷ 解决率,由 THE DAILY BRIEF 计算。榜单未说明单次成本是否计入 prompt caching,美元列请作方向性参考。

为什么这个分数低

  • Real-SWE 用的是经授权的真实企业私有生产代码库(含一个 20 万+ 用户的消费级产品、一个处理过 10 万+ 银行对账单的金融科技平台),代码与解都不公开,天然不具备记忆优势。
  • 解决方案中位触及 11 个文件,几乎是 FrontierCode / DeepSWE 等基准(中位 6 个)的两倍
  • 10 个任务里 6 个成功率低于 15%:计费排程迁移 14.1%、API token 计量 12.5%、S3 存储追踪 10.9%、linearizable scan 4.7%、税务辖区 bug 3.1%;analytics stream reducer 在 64 次尝试中无一模型解决

时间不买正确性

  • 10 分钟内完成的 rollout 71.4% 失败10 分钟以上的 rollout 73.4% 失败——延长运行时只带来约 2 个百分点的差异,属于噪声。

失败模式

  • Claude Fable 5.1:漏需求 36.7%、集成错误 34.7%
  • GPT-6 Astra:集成错误与未验证假设各 34%
  • Gemini 3.8 Flash:近半数失败含集成错误
  • GPT-5.6 Sol:未验证假设 43.3%

另一个独立结论:harness tax

  • Berkeley Sky Lab 测试 21 组模型 × harness 组合(Claude Code、Codex CLI、一个叫 Pi 的极简开源 harness):harness 几乎不改变成功率,但成本最多差 5 倍——Fable 5 在三个 harness 里都约 97%,Claude Code 的成本是 Pi 的两倍,部分原因是它首次模型调用携带的上下文是 Pi 的 10 倍。

背景与分析

一、公共基准的记忆污染问题,终于有了可对照的替代方案

Real-SWE 的立论建立在一条公开事实之上:OpenAI 曾审计 138 个 GPT-5.2 持续失败的 SWE-bench Verified 任务,结论是 59.4% 的任务本身有问题,且 GPT-5.2、Claude Opus 4.5、Gemini 3 Flash Preview 能凭记忆复现确切的修复(Decrypt 2026-02 报道)。

这不是第一次有人动手。Scale AI 的 SWE-Bench Pro(2025-09)已包含来自 18 家初创公司代码库的 276 个商业子集实例:Claude Opus 4.1 从公开集 22.7% 掉到商业集 17.8%,GPT-5 从 23.1% 掉到 14.9%。

Real-SWE 的新增价值有两点:用上了当前一代模型,以及——最值得抄的一点——为每个模型同时公布成本与失败模式数据。

读这份榜单要知道谁写的:Specific Labs 的主业就是把真实企业数据转成训练 Agent 的数据集。「前沿模型在私有代码上挣扎」这个结论同时也是它的销售论据。 这不代表数字是错的,但代表你应该在自己的代码上重跑一遍

二、38.8% 意味着什么:不是推理不行,是上下文找不着

这个榜单最有信息量的不是排名,是失败模式的分布

  • 漏需求集成错误合计占了 Fable 5.1 失败原因的七成以上;
  • GPT-5.6 Sol 有 43.3% 的失败源于未验证假设——它以为某件事成立,没去查就动手了。

这两类失败都不是模型推理能力问题,是「没找到正确的上下文」。 一个 11 文件的改动,Agent 要先把这 11 个文件找出来——存得下所有东西 ≠ 能检索到对的东西。

这也解释了为什么加时间没用:71.4% vs 73.4%,延长 rollout 只是让 Agent 多试几轮,而它缺的是入口,不是算力。再跑十分钟的循环重试修不好这个。

三、「每解决一任务成本」重排榜单,才是给决策者看的数字

把成本除以解决率之后,榜单几乎反转

  • 最便宜:Gemini 3.8 Flash $8.01(解决率 31.2%,单次仅 $2.50)
  • 最贵:Kimi K3 $20.74(解决率 18.8%,单次 $3.90)
  • Fable 5.1 排到最后一名 $17.94——它最准,但也最贵

但这个指标会骗人,因为它忽略了「人力成本」:一次失败的尝试不是免费的,总得有人发现它失败了。

THE DAILY BRIEF 算了一笔账:要落地 10 个成功修复,Fable 5.1 需要约 25.8 次尝试,Gemini 3.8 Flash 需要约 32.1 次。Flash 省下约 99 美元模型费,但多交给评审人约 6 次失败尝试

盈亏平衡点:如果你的团队发现一次失败尝试的人力成本高于约 16 美元,Fable 5.1 反而更便宜;对上 GPT-6 Astra,这个门槛降到约 11 美元

一个 11 文件的生产服务改动,11 美元的门槛相当低。 所以真正的决策变量是:你的流水线能多便宜地自动拒掉一个错误改动?

  • CI 强(失败的改动能被自动拦下)→ 平衡点抬高 → 偏向便宜模型;
  • CI 薄(要靠人读代码才发现)→ 偏向准确率高的模型。

四、「模型 + harness」才是正确的计分单位

Real-SWE 做对了一件很多榜单还没做的事:每个分数都绑定了具体 harness(Fable 5.1 配 Claude Code、Astra 配 Codex CLI、Gemini 3.8 Flash 配 Gemini CLI)。

38.8% 是「Fable 5.1 在 Claude Code 里、在私有代码上」的成绩,不是 Fable 5.1 这个模型的真空能力。 Fable 5.1 放进 Cursor 可能是完全不同的数字。

配合 Sky Lab 的 harness tax 一起看,结论很清晰:同一个模型,换个壳,成功率差不多、账单差 5 倍。 那些只挂模型名、不标 harness 的榜单,横向比较得出的结论基本是噪声。

对开发者的影响

  • 别再用公开基准的分数给团队选型。 SWE-bench 类分数被记忆污染是公开事实(OpenAI 自己审计出 59.4% 的任务有问题)。改为在自己的 3–5 个真实 issue 上跑一次,用「成功修复数 ÷ 总花费」这个比值决策。
  • 先算「每解决一任务成本」,再算单次调用成本。 便宜模型的单次成本低,但解决率低时总成本可能更高。参见 Gemini 3.8 FlashClaude Fable 5.1 的对照——$2.50 vs $6.96 的单次价,对应 $8.01 vs $17.94 的落地价。
  • 把 CI 强度当成选型的输入变量。 测试覆盖率高、能自动拦错误改动的团队可以用便宜模型;测试薄的团队买准确率,否则省下的模型费会变成评审工时。
  • 审查 harness 的默认配置。 Sky Lab 的结论是「大多数人因为用了默认值而在交 harness 税」——首次调用的上下文量是最大变量。用 Claude Code 的团队可以查一下首轮 prompt 到底塞了多少东西。参见 Claude Code
  • 给 Agent 明确的入口,而不是更大的窗口。 11 文件中位改动量说明瓶颈在检索:先告诉它改哪几个文件,比给它 1M 上下文更管用。
  • 别对「延长任务时长」抱期望。 71.4% vs 73.4% 的数据说明:跑不动的任务,再给它一小时也跑不动——不如把任务拆小、把约束写清楚。
  • 私有代码场景别照搬公开基准的结论。 包括本文这张表:10 个任务是小样本,且 Specific Labs 自身有商业立场。在自己的代码库上复现才是结论。

AI 之家 观点

  1. 38.8% 这个数字应该被写进每个「用 AI 重构祖传代码库」的项目立项书里。 不是用来劝退,是用来定验收标准——如果你指望 Agent 一次改对,那你预设的成功率高了三倍。
  2. 「每解决一任务成本」是 2026 年最该普及的 Agent 度量。 单次调用价格已经没有意义了:模型便宜但解决率低,等于把成本从 API 账单转移到了工程师的时间上。 建议所有团队把这个指标加进自己的看板。
  3. harness 正在成为新的成本黑洞。 同一模型差 5 倍,而大多数人根本不知道自己交了多少税——这是比模型选型更容易省钱的一环,只是没人去查。
  4. 失败模式比分数重要。 「漏需求」与「集成错误」占七成,说明当前 Agent 的短板是工程上下文,不是推理能力。给它更好的检索入口(代码图、调用链、变更影响面)比等下一代模型更现实。
  5. 对国内团队的直接结论:GLM 5.3 28.8%、Kimi K3 18.8% 这两个数字,配合国产模型的 API 价格,在「每解决一任务成本」上未必输给海外旗舰——但要注意 K3 在这个榜上是单价最贵的一档($20.74),便宜的 token 价不等于便宜的落地价
  6. 警惕小样本。 10 个任务、每模型 8 次尝试 = 80 次 rollout,样本量不足以支撑「模型 A 比模型 B 强」的强结论。本文所有排序请当作方向性参考。

待核实:Real-SWE 仅 10 个任务、80 次 rollout,样本量小;单次 rollout 成本未说明是否计入 prompt caching(Agentic 场景下缓存读常占大头),美元列请作方向性参考;Specific Labs 主业为「把企业数据转成 Agent 训练数据集」,存在商业立场;Sky Lab 的「21 组组合 / 5 倍成本差 / Fable 5 约 97%」转引自 Tech & AI Weekly 的综述,未能取得原始论文;各模型版本号以厂商官方为准。

相关阅读

来源

本资讯由 AI 之家 编辑部基于公开资料整理,非厂商付费内容;基准数据以 Specific Labs 官方榜单为准,欢迎在 反馈邮箱 反馈更新。

相关对比

Aider vs Claude Code:终端 AI 编程双雄怎么选

Aider vs Claude Code 2026 选型对比:开源 BYOK 多模型 vs Anthropic 订阅长任务 Agent,从编程能力、多模型支持、价格、Git 集成、国内可用性和适合人群判断,帮你选对终端 AI 编程工具。

Claude Code vs Cline:CLI AI Agent 怎么选?2026 对比

Claude Code vs Cline 2026 选型对比:Anthropic 官方闭源 CLI Agent vs Apache-2.0 开源 VS Code 插件。从模型绑定、工作流、MCP 支持、价格、隐私和适合人群 6 个维度帮你选对 CLI AI 编程工具。

Claude Code vs Codex CLI:终端 AI Agent 双雄对比

Claude Code vs Codex CLI 2026 选型对比:Anthropic 与 OpenAI 两大官方终端 Agent 的模型、长任务、MCP 生态、Windows 支持、订阅打包价格和国内可用性全方位对比,帮你判断该用哪个终端 AI Agent,以及能不能两个一起用。

Claude Code vs Crush:Anthropic 官方 vs 多模型 TUI(2026 实测选型)

Claude Code vs Crush 2026 选型对比:Anthropic 官方 CLI Agent(Claude only + 长任务最稳 + MCP 一等公民)vs Charmbracelet 开源 TUI Agent(多模型 mid-session 切换 + LSP + FSL-1.1-MIT)。从模型、长任务、生态、价格、国内可用性帮你选对终端 AI 编程工具。

Claude Code vs Gemini CLI:终端 AI Agent 怎么选?(2026 选型指南)

Claude Code 和 Gemini CLI 都是终端原生的 AI 编码 Agent。一句话结论 + 决策树 + 价格 + 国内可用性对比:长任务与 CLAUDE.md 生态选前者,免费额度与接入门槛选后者。

Codex CLI vs Crush:OpenAI 官方 vs 多模型 TUI(2026 实测选型)

Codex CLI vs Crush 2026 选型对比:OpenAI 官方终端 Coding Agent(GPT-5.6 + Windows 原生沙箱 + Apache-2.0)vs Charmbracelet 开源 TUI Agent(多模型 mid-session 切换 + LSP + FSL-1.1-MIT)。从模型、平台、生态、价格、国内可用性帮你选对终端 AI 编程工具。

相关评测