跳到主内容
概念Terminal-Bench基准测试AI 编程Agent终端模型评测SWE-bench

Terminal-Bench

Terminal-Bench 考的是 Agent 在真实终端里把一件事做完的能力——装依赖、改配置、跑命令、排查报错直到验收通过。它补上了 SWE-bench 不考的「用机器」能力,但 2.1 与 4.0 分数不可直接比较。

发布 2026-09-22更新 2026-09-22

什么是 Terminal-Bench

Terminal-Bench 是一类面向终端环境的 Agent 基准:给 Agent 一个真实的命令行环境(通常是一个容器),提出一个需要多步操作才能完成的目标,然后用脚本自动验收结果。

它考的不是「能不能写出正确的代码」,而是能不能把这台机器用好

  • 装依赖、配环境、改配置文件;
  • 读懂报错并据此调整下一步;
  • 在几十步的操作序列里不跑偏、不中途放弃;
  • 最终产出一个可被机器验收的状态(文件、服务、命令输出)。

这也是它和 SWE-bench 最本质的分工:SWE-bench 考「解题」——给一个真实 issue,定位并修复,用单元测试验收;Terminal-Bench 考「用机器」——环境本身就是考题的一部分。两者都强的模型,才适合做终端 Agent 的底座,原因见智能体编程

为什么 2026 年它变得这么重要

2026 年编程 Agent 的主战场从「补全和改代码」转向「长时间自主干活」。一旦 Agent 的运行时长从几秒拉到几小时,决定成败的能力就变了:

能力短任务时代长程 Agent 时代
代码生成质量决定性必要但不充分
多步规划次要决定性
读报错自我修正次要决定性
上下文管理次要决定成本与稳定性

Terminal-Bench 恰好集中考后三项,所以它成为各家发布模型时最常引用的硬指标之一——本站多张模型卡都把它和 SWE-bench 并列,例如 Claude Fable 5.1GPT-6 AstraDeepSeek V4.1 Flash

版本:2.0 / 2.1 / 4.0 的难度不是一条线

站内引用到的版本主要有三代,它们的任务集、难度与验收方式都发生过变化

版本站内常见引用场景读分注意
2.0 / 2.1早期旗舰对比,如 Claude Sonnet 5 2.1 达 80.4%、DeepSeek V4.1 Flash 2.1 达 90.6分数普遍偏高,属于难度较早期的一档
4.02026 下半年主流,如 GPT-6 Astra 57.9%、Claude Fable 5.1 55.8%任务更难、更贴近真实长程,分数显著低于 2.x

最重要的一条纪律:跨版本分数不可比较。 看到「某模型 Terminal-Bench 90.6」时,第一反应应该是问「哪个版本、什么 harness」。90.6(2.1)与 57.9(4.0)之间不是差距,而是两把不同的尺子。

三个最常见的读分坑

坑一:厂商自己的 harness 不等于官方榜单

同一个模型,跑在自家 CLI 里和跑在基准官方 harness 里,分数可以差很远。部分厂商公布的是「自家 harness 自测分」,并明确说明尚未进入官方榜单——这类数字只能当作参考区间,不能与官方榜单并列排名。

判断方法很简单:看有没有说清 harness。只给分数不给运行环境的,按「信息不全」处理。

坑二:单题短程 ≠ 实战长程

基准里的任务通常边界清晰、验收确定。真实仓库里的脏上下文、隐式依赖、历史包袱会被成倍放大,所以榜单领先不等于你的仓库里也领先。选型时最可靠的仍然是用自己的仓库抽样 20 题——这一点与 SWE-bench 读榜的纪律完全一致。

坑三:只看分数不看成本

两个模型分数接近时,成本往往差几倍。长程 Agent 场景应该同时看单次任务成本:把「分数 / 每任务花费」一起放在表里比较,才是有决策价值的对比。这也是本站模型卡普遍同时标注基准与定价的原因。

与相邻基准怎么搭配看

基准主要考察与 Terminal-Bench 的关系
SWE-bench真实 issue 修复,单元测试验收互补:解题 vs 用机器
AutomationBench真实 SaaS 工具链多步业务流相近:都考「跑完一件事」,但更偏云端业务
FrontierCode前沿代码能力互补:更接近纯编码难度
OSWorld桌面 GUI 操作同类延伸:从终端扩展到图形界面

一个模型如果在 Terminal-Bench 很强但 SWE-bench 一般,通常说明工具调用与自我修正强、代码理解偏弱——反过来则相反。两张榜单一起看,才能判断它适合当「执行层」还是「规划层」,这也正是多 Agent 编排里分工的依据。

哪些工具吃这个分数

终端形态的 Agent 是 Terminal-Bench 分数的直接受益方,也是主要引用方:

  • Claude Code —— 终端 Agent 的标杆参照系
  • Codex CLI —— 与 Claude Code 长期并列对比
  • MiMo Code —— 国产阵营中主打终端基准的一档
  • Gemini CLI —— Google 的终端入口

FAQ

Terminal-Bench 和 SWE-bench 该看哪个? 看你要它干什么。选代码修复与仓库理解能力看 SWE-bench;选长程自主执行能力看 Terminal-Bench。做终端 Agent 底座的话,两个都要看,且都要确认版本。

为什么同一篇发布稿里 Terminal-Bench 2.1 很高但 4.0 很低? 正常现象。4.0 难度显著提高、任务更贴近真实长程,多数模型在 4.0 上都会大幅回落。如果一个模型只公布 2.1 而回避 4.0,应视为信息不完整。

分数接近时怎么选模型? 比每任务成本,再比稳定性(长会话是否跑偏)。具体方法见长上下文中关于成本与上下文管理的取舍。

延伸阅读

来源

本文为概念性说明,事实依据来自本站已核实的模型卡(各卡均标注基准版本与一手来源,见上方延伸阅读)。Terminal-Bench 的任务集、版本难度与官方榜单以官方发布为准;厂商自选 harness 自报的分数在本文中一律按「参考区间」处理,未与官方榜单并列排名。

相关对比

Aider vs Claude Code:终端 AI 编程双雄怎么选

Aider vs Claude Code 2026 选型对比:开源 BYOK 多模型 vs Anthropic 订阅长任务 Agent,从编程能力、多模型支持、价格、Git 集成、国内可用性和适合人群判断,帮你选对终端 AI 编程工具。

Claude Code vs Cline:CLI AI Agent 怎么选?2026 对比

Claude Code vs Cline 2026 选型对比:Anthropic 官方闭源 CLI Agent vs Apache-2.0 开源 VS Code 插件。从模型绑定、工作流、MCP 支持、价格、隐私和适合人群 6 个维度帮你选对 CLI AI 编程工具。

Claude Code vs Codex CLI:终端 AI Agent 双雄对比

Claude Code vs Codex CLI 2026 选型对比:Anthropic 与 OpenAI 两大官方终端 Agent 的模型、长任务、MCP 生态、Windows 支持、订阅打包价格和国内可用性全方位对比,帮你判断该用哪个终端 AI Agent,以及能不能两个一起用。

Claude Code vs Crush:Anthropic 官方 vs 多模型 TUI(2026 实测选型)

Claude Code vs Crush 2026 选型对比:Anthropic 官方 CLI Agent(Claude only + 长任务最稳 + MCP 一等公民)vs Charmbracelet 开源 TUI Agent(多模型 mid-session 切换 + LSP + FSL-1.1-MIT)。从模型、长任务、生态、价格、国内可用性帮你选对终端 AI 编程工具。

Claude Code vs Gemini CLI:终端 AI Agent 怎么选?(2026 选型指南)

Claude Code 和 Gemini CLI 都是终端原生的 AI 编码 Agent。一句话结论 + 决策树 + 价格 + 国内可用性对比:长任务与 CLAUDE.md 生态选前者,免费额度与接入门槛选后者。

Codex CLI vs Crush:OpenAI 官方 vs 多模型 TUI(2026 实测选型)

Codex CLI vs Crush 2026 选型对比:OpenAI 官方终端 Coding Agent(GPT-5.6 + Windows 原生沙箱 + Apache-2.0)vs Charmbracelet 开源 TUI Agent(多模型 mid-session 切换 + LSP + FSL-1.1-MIT)。从模型、平台、生态、价格、国内可用性帮你选对终端 AI 编程工具。