Real-SWE:把最强编码 Agent 丢进真实企业私有代码库,Claude Fable 5.1 只拿到 38.8%
2026-09-19 · Specific Labs Real-SWE / THE DAILY BRIEF (beri.net) / World Programming / DEV Community / AI Miner / Eli's Tech & AI Weekly
要点
榜单(模型 + 其配套 harness,每个任务 8 次尝试)
| 排名 | 模型 / Harness | 解决率 | 单次 rollout 成本 | 每解决一任务成本 |
|---|---|---|---|---|
| 1 | Claude Fable 5.1 / Claude Code | 38.8% | $6.96 | $17.94 |
| 2 | GPT-6 Astra / Codex CLI | 33.8% | $4.67 | $13.82 |
| 3 | Gemini 3.8 Flash / Gemini CLI | 31.2% | $2.50 | $8.01 |
| 4 | GLM 5.3 / Claude Code | 28.8% | $5.12 | $17.78 |
| 5 | Grok 4.6 / Grok Build | 23.8% | $3.44 | $14.45 |
| 5 | Muse Spark 1.3 / Muse Code | 23.8% | $2.74 | $11.51 |
| 7 | Kimi K3 / Kimi Code | 18.8% | $3.90 | $20.74 |
| 8 | GPT-5.6 Sol / Codex CLI | 16.2% | $2.65 | $16.36 |
前四列来自 Real-SWE 榜单,「每解决一任务成本」= 单次成本 ÷ 解决率,由 THE DAILY BRIEF 计算。榜单未说明单次成本是否计入 prompt caching,美元列请作方向性参考。
为什么这个分数低
- Real-SWE 用的是经授权的真实企业私有生产代码库(含一个 20 万+ 用户的消费级产品、一个处理过 10 万+ 银行对账单的金融科技平台),代码与解都不公开,天然不具备记忆优势。
- 解决方案中位触及 11 个文件,几乎是 FrontierCode / DeepSWE 等基准(中位 6 个)的两倍。
- 10 个任务里 6 个成功率低于 15%:计费排程迁移 14.1%、API token 计量 12.5%、S3 存储追踪 10.9%、linearizable scan 4.7%、税务辖区 bug 3.1%;analytics stream reducer 在 64 次尝试中无一模型解决。
时间不买正确性
- 10 分钟内完成的 rollout 71.4% 失败;10 分钟以上的 rollout 73.4% 失败——延长运行时只带来约 2 个百分点的差异,属于噪声。
失败模式
- Claude Fable 5.1:漏需求 36.7%、集成错误 34.7%
- GPT-6 Astra:集成错误与未验证假设各 34%
- Gemini 3.8 Flash:近半数失败含集成错误
- GPT-5.6 Sol:未验证假设 43.3%
另一个独立结论:harness tax
- Berkeley Sky Lab 测试 21 组模型 × harness 组合(Claude Code、Codex CLI、一个叫 Pi 的极简开源 harness):harness 几乎不改变成功率,但成本最多差 5 倍——Fable 5 在三个 harness 里都约 97%,Claude Code 的成本是 Pi 的两倍,部分原因是它首次模型调用携带的上下文是 Pi 的 10 倍。
背景与分析
一、公共基准的记忆污染问题,终于有了可对照的替代方案
Real-SWE 的立论建立在一条公开事实之上:OpenAI 曾审计 138 个 GPT-5.2 持续失败的 SWE-bench Verified 任务,结论是 59.4% 的任务本身有问题,且 GPT-5.2、Claude Opus 4.5、Gemini 3 Flash Preview 能凭记忆复现确切的修复(Decrypt 2026-02 报道)。
这不是第一次有人动手。Scale AI 的 SWE-Bench Pro(2025-09)已包含来自 18 家初创公司代码库的 276 个商业子集实例:Claude Opus 4.1 从公开集 22.7% 掉到商业集 17.8%,GPT-5 从 23.1% 掉到 14.9%。
Real-SWE 的新增价值有两点:用上了当前一代模型,以及——最值得抄的一点——为每个模型同时公布成本与失败模式数据。
读这份榜单要知道谁写的:Specific Labs 的主业就是把真实企业数据转成训练 Agent 的数据集。「前沿模型在私有代码上挣扎」这个结论同时也是它的销售论据。 这不代表数字是错的,但代表你应该在自己的代码上重跑一遍。
二、38.8% 意味着什么:不是推理不行,是上下文找不着
这个榜单最有信息量的不是排名,是失败模式的分布:
- 漏需求与集成错误合计占了 Fable 5.1 失败原因的七成以上;
- GPT-5.6 Sol 有 43.3% 的失败源于未验证假设——它以为某件事成立,没去查就动手了。
这两类失败都不是模型推理能力问题,是「没找到正确的上下文」。 一个 11 文件的改动,Agent 要先把这 11 个文件找出来——存得下所有东西 ≠ 能检索到对的东西。
这也解释了为什么加时间没用:71.4% vs 73.4%,延长 rollout 只是让 Agent 多试几轮,而它缺的是入口,不是算力。再跑十分钟的循环重试修不好这个。
三、「每解决一任务成本」重排榜单,才是给决策者看的数字
把成本除以解决率之后,榜单几乎反转:
- 最便宜:Gemini 3.8 Flash $8.01(解决率 31.2%,单次仅 $2.50)
- 最贵:Kimi K3 $20.74(解决率 18.8%,单次 $3.90)
- Fable 5.1 排到最后一名 $17.94——它最准,但也最贵
但这个指标会骗人,因为它忽略了「人力成本」:一次失败的尝试不是免费的,总得有人发现它失败了。
THE DAILY BRIEF 算了一笔账:要落地 10 个成功修复,Fable 5.1 需要约 25.8 次尝试,Gemini 3.8 Flash 需要约 32.1 次。Flash 省下约 99 美元模型费,但多交给评审人约 6 次失败尝试。
盈亏平衡点:如果你的团队发现一次失败尝试的人力成本高于约 16 美元,Fable 5.1 反而更便宜;对上 GPT-6 Astra,这个门槛降到约 11 美元。
一个 11 文件的生产服务改动,11 美元的门槛相当低。 所以真正的决策变量是:你的流水线能多便宜地自动拒掉一个错误改动?
- CI 强(失败的改动能被自动拦下)→ 平衡点抬高 → 偏向便宜模型;
- CI 薄(要靠人读代码才发现)→ 偏向准确率高的模型。
四、「模型 + harness」才是正确的计分单位
Real-SWE 做对了一件很多榜单还没做的事:每个分数都绑定了具体 harness(Fable 5.1 配 Claude Code、Astra 配 Codex CLI、Gemini 3.8 Flash 配 Gemini CLI)。
38.8% 是「Fable 5.1 在 Claude Code 里、在私有代码上」的成绩,不是 Fable 5.1 这个模型的真空能力。 Fable 5.1 放进 Cursor 可能是完全不同的数字。
配合 Sky Lab 的 harness tax 一起看,结论很清晰:同一个模型,换个壳,成功率差不多、账单差 5 倍。 那些只挂模型名、不标 harness 的榜单,横向比较得出的结论基本是噪声。
对开发者的影响
- 别再用公开基准的分数给团队选型。 SWE-bench 类分数被记忆污染是公开事实(OpenAI 自己审计出 59.4% 的任务有问题)。改为在自己的 3–5 个真实 issue 上跑一次,用「成功修复数 ÷ 总花费」这个比值决策。
- 先算「每解决一任务成本」,再算单次调用成本。 便宜模型的单次成本低,但解决率低时总成本可能更高。参见 Gemini 3.8 Flash 与 Claude Fable 5.1 的对照——$2.50 vs $6.96 的单次价,对应 $8.01 vs $17.94 的落地价。
- 把 CI 强度当成选型的输入变量。 测试覆盖率高、能自动拦错误改动的团队可以用便宜模型;测试薄的团队买准确率,否则省下的模型费会变成评审工时。
- 审查 harness 的默认配置。 Sky Lab 的结论是「大多数人因为用了默认值而在交 harness 税」——首次调用的上下文量是最大变量。用 Claude Code 的团队可以查一下首轮 prompt 到底塞了多少东西。参见 Claude Code。
- 给 Agent 明确的入口,而不是更大的窗口。 11 文件中位改动量说明瓶颈在检索:先告诉它改哪几个文件,比给它 1M 上下文更管用。
- 别对「延长任务时长」抱期望。 71.4% vs 73.4% 的数据说明:跑不动的任务,再给它一小时也跑不动——不如把任务拆小、把约束写清楚。
- 私有代码场景别照搬公开基准的结论。 包括本文这张表:10 个任务是小样本,且 Specific Labs 自身有商业立场。在自己的代码库上复现才是结论。
AI 之家 观点
- 38.8% 这个数字应该被写进每个「用 AI 重构祖传代码库」的项目立项书里。 不是用来劝退,是用来定验收标准——如果你指望 Agent 一次改对,那你预设的成功率高了三倍。
- 「每解决一任务成本」是 2026 年最该普及的 Agent 度量。 单次调用价格已经没有意义了:模型便宜但解决率低,等于把成本从 API 账单转移到了工程师的时间上。 建议所有团队把这个指标加进自己的看板。
- harness 正在成为新的成本黑洞。 同一模型差 5 倍,而大多数人根本不知道自己交了多少税——这是比模型选型更容易省钱的一环,只是没人去查。
- 失败模式比分数重要。 「漏需求」与「集成错误」占七成,说明当前 Agent 的短板是工程上下文,不是推理能力。给它更好的检索入口(代码图、调用链、变更影响面)比等下一代模型更现实。
- 对国内团队的直接结论:GLM 5.3 28.8%、Kimi K3 18.8% 这两个数字,配合国产模型的 API 价格,在「每解决一任务成本」上未必输给海外旗舰——但要注意 K3 在这个榜上是单价最贵的一档($20.74),便宜的 token 价不等于便宜的落地价。
- 警惕小样本。 10 个任务、每模型 8 次尝试 = 80 次 rollout,样本量不足以支撑「模型 A 比模型 B 强」的强结论。本文所有排序请当作方向性参考。
待核实:Real-SWE 仅 10 个任务、80 次 rollout,样本量小;单次 rollout 成本未说明是否计入 prompt caching(Agentic 场景下缓存读常占大头),美元列请作方向性参考;Specific Labs 主业为「把企业数据转成 Agent 训练数据集」,存在商业立场;Sky Lab 的「21 组组合 / 5 倍成本差 / Fable 5 约 97%」转引自 Tech & AI Weekly 的综述,未能取得原始论文;各模型版本号以厂商官方为准。
相关阅读
- 模型卡:Claude Fable 5.1 · GPT-6 Astra · Gemini 3.8 Flash · GLM-5.3 · Kimi K3 · Grok 4.6 · GPT-5.6
- 工具卡:Claude Code · Codex CLI · Gemini CLI · Kimi Code · Muse Code
- 本期专题:AI 编程周报 2026-09-19 · 华为 Peerium 计算架构 · Manus 估值翻倍
- 往期:AI 编程周报 2026-09-18 · AI 编程周报 2026-09-17
- 概念:SWE-bench · Agentic Coding · 上下文工程 · 长上下文 · Prompt Caching
来源
- Fable Cost $18 a Fix on Private Code. Flash Cost $8.(THE DAILY BRIEF / beri.net)
- AI's best coding agent fails 60% of the time — and the data backs it up(World Programming)
- Giving a coding agent more time barely helps(DEV Community)
- 用真实企业的私有代码评估 AI!新基准「Real-SWE」发布(AI Miner,中文)
- Same model, 5x the bill, depending on the harness(Tech & AI Weekly by Eli,2026-09-18)
- Real-SWE 榜单(Specific Labs 官方)
本资讯由 AI 之家 编辑部基于公开资料整理,非厂商付费内容;基准数据以 Specific Labs 官方榜单为准,欢迎在 反馈邮箱 反馈更新。