Terminal-Bench
Terminal-Bench 考的是 Agent 在真实终端里把一件事做完的能力——装依赖、改配置、跑命令、排查报错直到验收通过。它补上了 SWE-bench 不考的「用机器」能力,但 2.1 与 4.0 分数不可直接比较。
发布 2026-09-22更新 2026-09-22什么是 Terminal-Bench
Terminal-Bench 是一类面向终端环境的 Agent 基准:给 Agent 一个真实的命令行环境(通常是一个容器),提出一个需要多步操作才能完成的目标,然后用脚本自动验收结果。
它考的不是「能不能写出正确的代码」,而是能不能把这台机器用好:
- 装依赖、配环境、改配置文件;
- 读懂报错并据此调整下一步;
- 在几十步的操作序列里不跑偏、不中途放弃;
- 最终产出一个可被机器验收的状态(文件、服务、命令输出)。
这也是它和 SWE-bench 最本质的分工:SWE-bench 考「解题」——给一个真实 issue,定位并修复,用单元测试验收;Terminal-Bench 考「用机器」——环境本身就是考题的一部分。两者都强的模型,才适合做终端 Agent 的底座,原因见智能体编程。
为什么 2026 年它变得这么重要
2026 年编程 Agent 的主战场从「补全和改代码」转向「长时间自主干活」。一旦 Agent 的运行时长从几秒拉到几小时,决定成败的能力就变了:
| 能力 | 短任务时代 | 长程 Agent 时代 |
|---|---|---|
| 代码生成质量 | 决定性 | 必要但不充分 |
| 多步规划 | 次要 | 决定性 |
| 读报错自我修正 | 次要 | 决定性 |
| 上下文管理 | 次要 | 决定成本与稳定性 |
Terminal-Bench 恰好集中考后三项,所以它成为各家发布模型时最常引用的硬指标之一——本站多张模型卡都把它和 SWE-bench 并列,例如 Claude Fable 5.1、GPT-6 Astra、DeepSeek V4.1 Flash。
版本:2.0 / 2.1 / 4.0 的难度不是一条线
站内引用到的版本主要有三代,它们的任务集、难度与验收方式都发生过变化:
| 版本 | 站内常见引用场景 | 读分注意 |
|---|---|---|
| 2.0 / 2.1 | 早期旗舰对比,如 Claude Sonnet 5 2.1 达 80.4%、DeepSeek V4.1 Flash 2.1 达 90.6 | 分数普遍偏高,属于难度较早期的一档 |
| 4.0 | 2026 下半年主流,如 GPT-6 Astra 57.9%、Claude Fable 5.1 55.8% | 任务更难、更贴近真实长程,分数显著低于 2.x |
最重要的一条纪律:跨版本分数不可比较。 看到「某模型 Terminal-Bench 90.6」时,第一反应应该是问「哪个版本、什么 harness」。90.6(2.1)与 57.9(4.0)之间不是差距,而是两把不同的尺子。
三个最常见的读分坑
坑一:厂商自己的 harness 不等于官方榜单
同一个模型,跑在自家 CLI 里和跑在基准官方 harness 里,分数可以差很远。部分厂商公布的是「自家 harness 自测分」,并明确说明尚未进入官方榜单——这类数字只能当作参考区间,不能与官方榜单并列排名。
判断方法很简单:看有没有说清 harness。只给分数不给运行环境的,按「信息不全」处理。
坑二:单题短程 ≠ 实战长程
基准里的任务通常边界清晰、验收确定。真实仓库里的脏上下文、隐式依赖、历史包袱会被成倍放大,所以榜单领先不等于你的仓库里也领先。选型时最可靠的仍然是用自己的仓库抽样 20 题——这一点与 SWE-bench 读榜的纪律完全一致。
坑三:只看分数不看成本
两个模型分数接近时,成本往往差几倍。长程 Agent 场景应该同时看单次任务成本:把「分数 / 每任务花费」一起放在表里比较,才是有决策价值的对比。这也是本站模型卡普遍同时标注基准与定价的原因。
与相邻基准怎么搭配看
| 基准 | 主要考察 | 与 Terminal-Bench 的关系 |
|---|---|---|
| SWE-bench | 真实 issue 修复,单元测试验收 | 互补:解题 vs 用机器 |
| AutomationBench | 真实 SaaS 工具链多步业务流 | 相近:都考「跑完一件事」,但更偏云端业务 |
| FrontierCode | 前沿代码能力 | 互补:更接近纯编码难度 |
| OSWorld | 桌面 GUI 操作 | 同类延伸:从终端扩展到图形界面 |
一个模型如果在 Terminal-Bench 很强但 SWE-bench 一般,通常说明工具调用与自我修正强、代码理解偏弱——反过来则相反。两张榜单一起看,才能判断它适合当「执行层」还是「规划层」,这也正是多 Agent 编排里分工的依据。
哪些工具吃这个分数
终端形态的 Agent 是 Terminal-Bench 分数的直接受益方,也是主要引用方:
- Claude Code —— 终端 Agent 的标杆参照系
- Codex CLI —— 与 Claude Code 长期并列对比
- MiMo Code —— 国产阵营中主打终端基准的一档
- Gemini CLI —— Google 的终端入口
FAQ
Terminal-Bench 和 SWE-bench 该看哪个? 看你要它干什么。选代码修复与仓库理解能力看 SWE-bench;选长程自主执行能力看 Terminal-Bench。做终端 Agent 底座的话,两个都要看,且都要确认版本。
为什么同一篇发布稿里 Terminal-Bench 2.1 很高但 4.0 很低? 正常现象。4.0 难度显著提高、任务更贴近真实长程,多数模型在 4.0 上都会大幅回落。如果一个模型只公布 2.1 而回避 4.0,应视为信息不完整。
分数接近时怎么选模型? 比每任务成本,再比稳定性(长会话是否跑偏)。具体方法见长上下文中关于成本与上下文管理的取舍。
延伸阅读
- SWE-bench:基准怎么读才不被忽悠
- Agentic Coding:什么是智能体编程
- 多 Agent 编排:coordinator / worker 模式
- Claude Fable 5.1 模型卡
- GPT-6 Astra 模型卡
- DeepSeek V4.1 Flash 模型卡
- Kimi K3 模型卡
- Claude Code 工具卡
- Codex CLI 工具卡
- 长上下文:成本与上下文管理
来源
本文为概念性说明,事实依据来自本站已核实的模型卡(各卡均标注基准版本与一手来源,见上方延伸阅读)。Terminal-Bench 的任务集、版本难度与官方榜单以官方发布为准;厂商自选 harness 自报的分数在本文中一律按「参考区间」处理,未与官方榜单并列排名。
Aider vs Claude Code:终端 AI 编程双雄怎么选
Aider vs Claude Code 2026 选型对比:开源 BYOK 多模型 vs Anthropic 订阅长任务 Agent,从编程能力、多模型支持、价格、Git 集成、国内可用性和适合人群判断,帮你选对终端 AI 编程工具。
Claude Code vs Cline:CLI AI Agent 怎么选?2026 对比
Claude Code vs Cline 2026 选型对比:Anthropic 官方闭源 CLI Agent vs Apache-2.0 开源 VS Code 插件。从模型绑定、工作流、MCP 支持、价格、隐私和适合人群 6 个维度帮你选对 CLI AI 编程工具。
Claude Code vs Codex CLI:终端 AI Agent 双雄对比
Claude Code vs Codex CLI 2026 选型对比:Anthropic 与 OpenAI 两大官方终端 Agent 的模型、长任务、MCP 生态、Windows 支持、订阅打包价格和国内可用性全方位对比,帮你判断该用哪个终端 AI Agent,以及能不能两个一起用。
Claude Code vs Crush:Anthropic 官方 vs 多模型 TUI(2026 实测选型)
Claude Code vs Crush 2026 选型对比:Anthropic 官方 CLI Agent(Claude only + 长任务最稳 + MCP 一等公民)vs Charmbracelet 开源 TUI Agent(多模型 mid-session 切换 + LSP + FSL-1.1-MIT)。从模型、长任务、生态、价格、国内可用性帮你选对终端 AI 编程工具。
Claude Code vs Gemini CLI:终端 AI Agent 怎么选?(2026 选型指南)
Claude Code 和 Gemini CLI 都是终端原生的 AI 编码 Agent。一句话结论 + 决策树 + 价格 + 国内可用性对比:长任务与 CLAUDE.md 生态选前者,免费额度与接入门槛选后者。
Codex CLI vs Crush:OpenAI 官方 vs 多模型 TUI(2026 实测选型)
Codex CLI vs Crush 2026 选型对比:OpenAI 官方终端 Coding Agent(GPT-5.6 + Windows 原生沙箱 + Apache-2.0)vs Charmbracelet 开源 TUI Agent(多模型 mid-session 切换 + LSP + FSL-1.1-MIT)。从模型、平台、生态、价格、国内可用性帮你选对终端 AI 编程工具。