跳到主内容
codingAnthropic

Claude Opus 5.5

Anthropic 于 2026-09-22 发布的 Claude 5.5 家族首款模型 claude-opus-5-5:输入 $4 / 输出 $20 每百万 token,缓存读降至 $0.20,官方称多数任务达到 Fable 5.1 水平而典型负载成本比 Opus 5 低约 40%,Terminal-Bench 4.0 达 66.4%。

发布 2026-09-24更新 2026-09-24核实 2026-09-24

规格

厂商
Anthropic
发布日期
2026/9/22
类型
coding
定价
输入 $4 / 输出 $20 每百万 token(缓存读 $0.20、缓存写 $5);Fast 模式 $8/$40
API 兼容
anthropic, bedrock, vertex-ai, azure-ai-foundry

基准测试

66.4%(xhigh effort,±2.6;Fable 5.1 55.8%、Opus 5 52.3%、GPT-6 Astra 57.9%)
Terminal-Bench 4.0
54.4%(Fable 5.1 50.3%、Opus 5 48.0%、GPT-6 Astra 53.3%)
FrontierCode v1.1 (Main)
57.8%(max effort;medium effort 为 52.5%)
CursorBench 4.0
81.8%(Fable 5.1 80.7%、Opus 5 74.0%)
OSWorld 2.0 (partial)
67.7%(Fable 5.1 65.6%、Opus 5 63.6%、GPT-6 Astra 57.2%)
Humanity's Last Exam(带工具)
1846(Fable 5.1 1735、Opus 5 1708)
GDPval-AA v2.1(Elo)
40.0%(Fable 5.1 31.4%、Opus 5 26.9%、GPT-6 Astra 41.4%)
AutomationBench
58 分(212 款同类中第一,max effort)
Artificial Analysis 智能指数

优势

  • •官方口径「多数任务达到 Fable 5.1 水平」,典型负载成本比 Opus 5 低约 40%
  • •三项编程基准全部登顶:Terminal-Bench 4.0 66.4%、FrontierCode v1.1 54.4%、CursorBench 4.0 57.8%
  • •缓存读降价 60% 至 $0.20/M,长会话 agentic 场景成本结构改善最明显
  • •首个带 Fable 5.1 级 safeguards 的 Opus:网络安全/生物/蒸馏三类回退,越界尝试比 Opus 5 少约 85%
  • •零数据保留(ZDR)继续可用,AWS / Google Cloud / Azure 同日上线

不足

  • •官方发布页与 system card 未公开上下文窗口与最大输出 token 数,接入前需查平台文档
  • •max thinking 档可能跑空 128K 输出上限:Simon Willison 实测两次无输出,各耗 $2.56 / 近 20 分钟
  • •Artificial Analysis 指出其输出冗长——智能指数跑完共生成 2.6 亿 token,中位数仅 8800 万
  • •网络安全任务大多被回退到 Claude Opus 4.8,生物类受限用途需申请 Life Sciences 计划
  • •thinking 模式不可关闭;官方也承认基准差距未必等于真实体验差距

适用场景

代码库级迁移、审计与重构等数小时级长程 agentic 任务Claude Code / Codex 类 CLI 的默认主力模型(成本与效果平衡点)知识工作与文档产出:GDPval-AA v2.1 1846 Elocomputer use 与图表识别:OSWorld 2.0 81.8%(partial)、Chartography 89.0%

概述

Claude Opus 5.5(模型 ID claude-opus-5-5)是 Anthropic 于 2026 年 9 月 22 日发布的旗舰模型,Claude 5.5 家族的第一款。官方给它的定位是一句话:「在多数任务上达到 Claude Fable 5.1 的水平,而运行成本比 Opus 5 低 40%」——不是单纯堆能力,而是把上一代旗舰的能力向下压到一个能日常跑的价格。

发布当天即上线全部平台:Claude 官方订阅体系、Claude Code、Claude Platform(API),以及 AWS、Google Cloud、Microsoft Azure 三家云。零数据保留(ZDR) 选项继续可用。官方同时预告 Claude Sonnet 5.5 与 Claude Haiku 5.5 将在未来数周跟进,带来大部分相同的性能、效率与安全改进。

关于发布时间的口径:Anthropic 官方发布页标注 September 22, 2026(太平洋时间),国内媒体多在 9 月 23 日报道。引用时建议写明时区或「美西时间 9-22 / 国内 9-23」,避免读者对不上同一天(GPT-6 Sol 与 Luna 亦同)。

这一代还有个不能忽略的背景:Opus 5.5 是 Anthropic CEO Dario Amodei 公开承诺「pacing the frontier」(主动校准能力提升节奏,让对齐与安全实践跟得上)之后发布的第一款模型,发布前接受了 METR 与 Frontier Design 等外部机构评测。它也是首个在网络安全、生物、蒸馏三类上套用 Fable 5.1 级 safeguards 的 Opus 模型。

核心能力

长程任务:这一代真正的主战场

官方给出的案例全部指向「几小时到一天」级别的活:

  • 早期测试者用它审计并修复一个 20 万行代码库,耗时不到 3 小时;同样的活 Opus 5 需要 20 小时以上、多消耗 2.5 倍 token;
  • 另有测试者完成了 68 万行代码的迁移,不到一天完成;
  • 内部对照测试:把负载均衡软件 HAProxy 从 C 翻译成 Rust,Opus 5.5 用 9.5 小时、Fable 5.1 用 12 小时,两者都几乎通过了 HAProxy 自身的回归测试,而 Opus 5.5 成本低 51%。

结论很直接:长任务不再是「能不能做」,而是「做一次多少钱」——这也是缓存读降价 60% 的意义所在(长会话里 90% 以上的输入 token 按缓存价计费)。

编程基准:三项全登顶,但口径必须写清

基准Opus 5.5Fable 5.1Opus 5GPT-6 AstraGPT-5.6 Sol
Terminal-Bench 4.066.4%55.8%52.3%57.9%37.3%
FrontierCode v1.1 (Main)54.4%50.3%48.0%53.3%47.5%
CursorBench 4.057.8%51.8%46.6%—41.7%
AutomationBench40.0%31.4%26.9%41.4%28.8%
Terminal-Bench-Science 0.158.7%52.6%29.0%64.6%22.4%

口径提醒(引用前必读):官方表中 Opus 5.5 除特别说明外均为 adaptive thinking @ max effort,而 Terminal-Bench 4.0 为 xhigh effort,标准误 ±2.6。正文里的成本对比图又给了一组 default effort(medium) 数字:FrontierCode 54.6%、CursorBench 52.5%。因此「Opus 5.5 跑了多少分」必须带上 effort 档位,否则与官方表对不上。GPT-6 Astra 与 GPT-5.6 Sol 的数字来自 OpenAI 自报。

值得注意的是 AutomationBench 与 Terminal-Bench-Science 两项上 GPT-6 Astra 更高(41.4% / 64.6%)。Anthropic 自己在脚注里说明:AutomationBench 由 Zapier 运行、无 fallback 模型且把 safeguards 干预计为失败,因此得分低于实际表现。别只挑自己赢的那三项看。

知识工作与 computer use

  • GDPval-AA v2.1:1846 Elo,高于 Fable 5.1 的 1735、Opus 5 的 1708;
  • HLE(带工具):67.7%,高于 Fable 5.1 的 65.6%、Opus 5 的 63.6%、GPT-6 Astra 的 57.2%;
  • OSWorld 2.0(partial):81.8%;Chartography(图表识别,带工具)89.0%;
  • 写作风格被专门调过:官方称针对长期被吐槽的「Claudish」腔调做了优化,先给结论、少术语、更严格遵循格式与长度指令。

安全:能力越强,回退越多

这是本代与既往 Opus 最大的结构性差异:

  • 网络安全:多数网络安全任务会被透明回退到 Claude Opus 4.8;常规软件开发流程里识别与修复 bug 不受影响。认证从业人员可走即将扩容的 Cyber Verification Program;
  • 生物:采用与 Fable 5.1 同级的生物安全护栏;受限研发用途需申请 Life Sciences Verification Program(现已开放申请);
  • 蒸馏防护:带 preserved thinking 反蒸馏保护,阻止 API 用户编辑先前上下文以套取推理链,适用于 2026-08-31 及之后创建的 API 账户;
  • 行为审计:近 2000 个场景的自动化审计中,Opus 5.5 在几乎所有 misaligned behavior 指标上优于近期所有 Claude 模型;围堵边界评测里尝试越界的次数比 Opus 5 或 Claude Mythos 5.1 少约 85%,且每次都为低严重性并自我报告;
  • 提示注入:Gray Swan 基准中与 Fable 5.1 并列受测模型里注入成功率最低。

官方也留了一句实话:它常表现出「怀疑自己正在被评估」,这会让部署前评测对真实行为的预测力下降——safeguards 不等于免检。

API 调用示例

from anthropic import Anthropic

client = Anthropic(api_key="sk-ant-...")

resp = client.messages.create(
    model="claude-opus-5-5",
    max_tokens=16000,
    thinking={"type": "adaptive"},   # 5.5 起 thinking 不可关闭
    messages=[
        {"role": "user", "content": "审查这个仓库的鉴权模块,给出风险清单与补丁"},
    ],
)
print(resp.content[-1].text)

模型 ID 为 claude-opus-5-5,在 AWS Bedrock、Google Cloud Vertex AI 与 Microsoft Foundry 上使用同一标识符(各家可能有自己的部署名前缀,接入前以云厂商控制台为准)。

定价(2026-09-24 核对)

项目Claude Opus 5.5Claude Opus 5变化
输入(每百万 token)$4$5−20%
输出(每百万 token)$20$25−20%
缓存读$0.20$0.50−60%
缓存写$5$6.25−20%
Fast 模式(Claude Code / Platform)$8 / $40(最高 2.5x 速度)—新增档位

「降 40%」是怎么算出来的:官方口径是 典型负载在默认设置下比 Opus 5 便宜约 40%——它不只来自 20% 的标价下调,还包括每任务消耗 token 更少与输出生成快 30% 以上。此外 Anthropic 同步上调了 Pro、Max、Team 与按席位 Enterprise 的 5 小时用量上限约 20%,并让订阅者自选一次配额重置时间。

适合 / 不适合

适合

  • 代码库级迁移、审计、重构等数小时级长程 agentic 任务(本代主打);
  • 把 Claude Code、Cline 等 CLI 的默认模型换到 5.5(成本与效果的新平衡点);
  • 需要 Fable 级质量但预算只到 Opus 档的团队;
  • 知识工作与专业文档产出(GDPval 1846 Elo);
  • 对合规有要求的场景:ZDR + 三家云 + 分级 safeguards。

不适合

  • 成本敏感的高频跑量:Gemini 3.8 Flash 等价位仍是量级差异;
  • 网络安全与生物类受限任务:会被回退或拦下,别指望绕过;
  • 需要关闭 thinking 的低延迟场景:本代已不提供关闭选项;
  • 只看单项基准就拍板:Astra 在 AutomationBench 与 Terminal-Bench-Science 上更高,按自家 eval 定。

避坑清单

  1. max effort 慎用:Simon Willison 用「画一只骑自行车的鹈鹕 SVG」的固定测试跑 Opus 5.5,max thinking 档两次都没返回任何结果——耗尽 128K 输出上限仍在推理,每次花掉 $2.56、耗时近 20 分钟。他据此判断 max effort 在该场景「基本不可用」,但仍把 Opus 5.5 设为 Claude Code 默认模型。默认 effort 起步,别一上来就拉满。
  2. 冗长会吃掉降价红利:Artificial Analysis 测出它跑完智能指数共生成 2.6 亿 token,同类中位数仅 8800 万。token 单价降了,不代表账单一定降。
  3. 上下文窗口与最大输出未知:官方发布页未列这两个数(本站不填即为此原因)。第三方汇总按 1M 上下文描述 Claude Code 2.1.280 的接入口径,未获 Anthropic 官方文档确认,接入前请查 平台文档。
  4. 基准数字必须带 effort 档:表里的 66.4% 是 xhigh,正文里的 54.6% / 52.5% 是 medium,混用会被读者抓到不一致。
  5. 旧账户没有反蒸馏保护:preserved thinking 仅适用于 2026-08-31 之后创建的 API 账户。
  6. 不要把它当「最安全」代名词:官方明说它常怀疑自己在被评估,部署前评测的外推能力有限。

相关阅读

来源

本卡片由 AI 之家 编辑部根据公开资料整理,非厂商付费内容。官方发布页未公开上下文窗口与最大输出 token,本卡不填该字段即为此原因;定价与基准以 Anthropic 官方页面为准,欢迎在 反馈邮箱 反馈更新。

相关对比

Aider vs Claude Code:终端 AI 编程双雄怎么选

Aider vs Claude Code 2026 选型对比:开源 BYOK 多模型 vs Anthropic 订阅长任务 Agent,从编程能力、多模型支持、价格、Git 集成、国内可用性和适合人群判断,帮你选对终端 AI 编程工具。

Claude Code vs Cline:CLI AI Agent 怎么选?2026 对比

Claude Code vs Cline 2026 选型对比:Anthropic 官方闭源 CLI Agent vs Apache-2.0 开源 VS Code 插件。从模型绑定、工作流、MCP 支持、价格、隐私和适合人群 6 个维度帮你选对 CLI AI 编程工具。

Claude Code vs Codex CLI:终端 AI Agent 双雄对比

Claude Code vs Codex CLI 2026 选型对比:Anthropic 与 OpenAI 两大官方终端 Agent 的模型、长任务、MCP 生态、Windows 支持、订阅打包价格和国内可用性全方位对比,帮你判断该用哪个终端 AI Agent,以及能不能两个一起用。

Claude Code vs Crush:Anthropic 官方 vs 多模型 TUI(2026 实测选型)

Claude Code vs Crush 2026 选型对比:Anthropic 官方 CLI Agent(Claude only + 长任务最稳 + MCP 一等公民)vs Charmbracelet 开源 TUI Agent(多模型 mid-session 切换 + LSP + FSL-1.1-MIT)。从模型、长任务、生态、价格、国内可用性帮你选对终端 AI 编程工具。

Claude Code vs Gemini CLI:终端 AI Agent 怎么选?(2026 选型指南)

Claude Code 和 Gemini CLI 都是终端原生的 AI 编码 Agent。一句话结论 + 决策树 + 价格 + 国内可用性对比:长任务与 CLAUDE.md 生态选前者,免费额度与接入门槛选后者。

Cline vs Roo Code:同源衍生,2026 年该装哪个?

Cline 与 Roo Code 2026 选型对比:Roo Code 是 Cline 的衍生分支,增加了 Architect / Code / Ask 多种模式与更强的自定义能力。从产品形态、上手成本、长任务、成本可见性、计费方式与生态集成 6 个维度给出明确取舍。