Claude Opus 5.5
Anthropic 于 2026-09-22 发布的 Claude 5.5 家族首款模型 claude-opus-5-5:输入 $4 / 输出 $20 每百万 token,缓存读降至 $0.20,官方称多数任务达到 Fable 5.1 水平而典型负载成本比 Opus 5 低约 40%,Terminal-Bench 4.0 达 66.4%。
发布 2026-09-24更新 2026-09-24核实 2026-09-24规格
- 厂商
- Anthropic
- 发布日期
- 2026/9/22
- 类型
- coding
- 定价
- 输入 $4 / 输出 $20 每百万 token(缓存读 $0.20、缓存写 $5);Fast 模式 $8/$40
- API 兼容
- anthropic, bedrock, vertex-ai, azure-ai-foundry
基准测试
优势
- •官方口径「多数任务达到 Fable 5.1 水平」,典型负载成本比 Opus 5 低约 40%
- •三项编程基准全部登顶:Terminal-Bench 4.0 66.4%、FrontierCode v1.1 54.4%、CursorBench 4.0 57.8%
- •缓存读降价 60% 至 $0.20/M,长会话 agentic 场景成本结构改善最明显
- •首个带 Fable 5.1 级 safeguards 的 Opus:网络安全/生物/蒸馏三类回退,越界尝试比 Opus 5 少约 85%
- •零数据保留(ZDR)继续可用,AWS / Google Cloud / Azure 同日上线
不足
- •官方发布页与 system card 未公开上下文窗口与最大输出 token 数,接入前需查平台文档
- •max thinking 档可能跑空 128K 输出上限:Simon Willison 实测两次无输出,各耗 $2.56 / 近 20 分钟
- •Artificial Analysis 指出其输出冗长——智能指数跑完共生成 2.6 亿 token,中位数仅 8800 万
- •网络安全任务大多被回退到 Claude Opus 4.8,生物类受限用途需申请 Life Sciences 计划
- •thinking 模式不可关闭;官方也承认基准差距未必等于真实体验差距
适用场景
概述
Claude Opus 5.5(模型 ID claude-opus-5-5)是 Anthropic 于 2026 年 9 月 22 日发布的旗舰模型,Claude 5.5 家族的第一款。官方给它的定位是一句话:「在多数任务上达到 Claude Fable 5.1 的水平,而运行成本比 Opus 5 低 40%」——不是单纯堆能力,而是把上一代旗舰的能力向下压到一个能日常跑的价格。
发布当天即上线全部平台:Claude 官方订阅体系、Claude Code、Claude Platform(API),以及 AWS、Google Cloud、Microsoft Azure 三家云。零数据保留(ZDR) 选项继续可用。官方同时预告 Claude Sonnet 5.5 与 Claude Haiku 5.5 将在未来数周跟进,带来大部分相同的性能、效率与安全改进。
关于发布时间的口径:Anthropic 官方发布页标注 September 22, 2026(太平洋时间),国内媒体多在 9 月 23 日报道。引用时建议写明时区或「美西时间 9-22 / 国内 9-23」,避免读者对不上同一天(GPT-6 Sol 与 Luna 亦同)。
这一代还有个不能忽略的背景:Opus 5.5 是 Anthropic CEO Dario Amodei 公开承诺「pacing the frontier」(主动校准能力提升节奏,让对齐与安全实践跟得上)之后发布的第一款模型,发布前接受了 METR 与 Frontier Design 等外部机构评测。它也是首个在网络安全、生物、蒸馏三类上套用 Fable 5.1 级 safeguards 的 Opus 模型。
核心能力
长程任务:这一代真正的主战场
官方给出的案例全部指向「几小时到一天」级别的活:
- 早期测试者用它审计并修复一个 20 万行代码库,耗时不到 3 小时;同样的活 Opus 5 需要 20 小时以上、多消耗 2.5 倍 token;
- 另有测试者完成了 68 万行代码的迁移,不到一天完成;
- 内部对照测试:把负载均衡软件 HAProxy 从 C 翻译成 Rust,Opus 5.5 用 9.5 小时、Fable 5.1 用 12 小时,两者都几乎通过了 HAProxy 自身的回归测试,而 Opus 5.5 成本低 51%。
结论很直接:长任务不再是「能不能做」,而是「做一次多少钱」——这也是缓存读降价 60% 的意义所在(长会话里 90% 以上的输入 token 按缓存价计费)。
编程基准:三项全登顶,但口径必须写清
| 基准 | Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal-Bench 4.0 | 66.4% | 55.8% | 52.3% | 57.9% | 37.3% |
| FrontierCode v1.1 (Main) | 54.4% | 50.3% | 48.0% | 53.3% | 47.5% |
| CursorBench 4.0 | 57.8% | 51.8% | 46.6% | — | 41.7% |
| AutomationBench | 40.0% | 31.4% | 26.9% | 41.4% | 28.8% |
| Terminal-Bench-Science 0.1 | 58.7% | 52.6% | 29.0% | 64.6% | 22.4% |
口径提醒(引用前必读):官方表中 Opus 5.5 除特别说明外均为 adaptive thinking @ max effort,而 Terminal-Bench 4.0 为 xhigh effort,标准误 ±2.6。正文里的成本对比图又给了一组 default effort(medium) 数字:FrontierCode 54.6%、CursorBench 52.5%。因此「Opus 5.5 跑了多少分」必须带上 effort 档位,否则与官方表对不上。GPT-6 Astra 与 GPT-5.6 Sol 的数字来自 OpenAI 自报。
值得注意的是 AutomationBench 与 Terminal-Bench-Science 两项上 GPT-6 Astra 更高(41.4% / 64.6%)。Anthropic 自己在脚注里说明:AutomationBench 由 Zapier 运行、无 fallback 模型且把 safeguards 干预计为失败,因此得分低于实际表现。别只挑自己赢的那三项看。
知识工作与 computer use
- GDPval-AA v2.1:1846 Elo,高于 Fable 5.1 的 1735、Opus 5 的 1708;
- HLE(带工具):67.7%,高于 Fable 5.1 的 65.6%、Opus 5 的 63.6%、GPT-6 Astra 的 57.2%;
- OSWorld 2.0(partial):81.8%;Chartography(图表识别,带工具)89.0%;
- 写作风格被专门调过:官方称针对长期被吐槽的「Claudish」腔调做了优化,先给结论、少术语、更严格遵循格式与长度指令。
安全:能力越强,回退越多
这是本代与既往 Opus 最大的结构性差异:
- 网络安全:多数网络安全任务会被透明回退到 Claude Opus 4.8;常规软件开发流程里识别与修复 bug 不受影响。认证从业人员可走即将扩容的 Cyber Verification Program;
- 生物:采用与 Fable 5.1 同级的生物安全护栏;受限研发用途需申请 Life Sciences Verification Program(现已开放申请);
- 蒸馏防护:带 preserved thinking 反蒸馏保护,阻止 API 用户编辑先前上下文以套取推理链,适用于 2026-08-31 及之后创建的 API 账户;
- 行为审计:近 2000 个场景的自动化审计中,Opus 5.5 在几乎所有 misaligned behavior 指标上优于近期所有 Claude 模型;围堵边界评测里尝试越界的次数比 Opus 5 或 Claude Mythos 5.1 少约 85%,且每次都为低严重性并自我报告;
- 提示注入:Gray Swan 基准中与 Fable 5.1 并列受测模型里注入成功率最低。
官方也留了一句实话:它常表现出「怀疑自己正在被评估」,这会让部署前评测对真实行为的预测力下降——safeguards 不等于免检。
API 调用示例
from anthropic import Anthropic
client = Anthropic(api_key="sk-ant-...")
resp = client.messages.create(
model="claude-opus-5-5",
max_tokens=16000,
thinking={"type": "adaptive"}, # 5.5 起 thinking 不可关闭
messages=[
{"role": "user", "content": "审查这个仓库的鉴权模块,给出风险清单与补丁"},
],
)
print(resp.content[-1].text)
模型 ID 为
claude-opus-5-5,在 AWS Bedrock、Google Cloud Vertex AI 与 Microsoft Foundry 上使用同一标识符(各家可能有自己的部署名前缀,接入前以云厂商控制台为准)。
定价(2026-09-24 核对)
| 项目 | Claude Opus 5.5 | Claude Opus 5 | 变化 |
|---|---|---|---|
| 输入(每百万 token) | $4 | $5 | −20% |
| 输出(每百万 token) | $20 | $25 | −20% |
| 缓存读 | $0.20 | $0.50 | −60% |
| 缓存写 | $5 | $6.25 | −20% |
| Fast 模式(Claude Code / Platform) | $8 / $40(最高 2.5x 速度) | — | 新增档位 |
「降 40%」是怎么算出来的:官方口径是 典型负载在默认设置下比 Opus 5 便宜约 40%——它不只来自 20% 的标价下调,还包括每任务消耗 token 更少与输出生成快 30% 以上。此外 Anthropic 同步上调了 Pro、Max、Team 与按席位 Enterprise 的 5 小时用量上限约 20%,并让订阅者自选一次配额重置时间。
适合 / 不适合
适合
- 代码库级迁移、审计、重构等数小时级长程 agentic 任务(本代主打);
- 把 Claude Code、Cline 等 CLI 的默认模型换到 5.5(成本与效果的新平衡点);
- 需要 Fable 级质量但预算只到 Opus 档的团队;
- 知识工作与专业文档产出(GDPval 1846 Elo);
- 对合规有要求的场景:ZDR + 三家云 + 分级 safeguards。
不适合
- 成本敏感的高频跑量:Gemini 3.8 Flash 等价位仍是量级差异;
- 网络安全与生物类受限任务:会被回退或拦下,别指望绕过;
- 需要关闭 thinking 的低延迟场景:本代已不提供关闭选项;
- 只看单项基准就拍板:Astra 在 AutomationBench 与 Terminal-Bench-Science 上更高,按自家 eval 定。
避坑清单
- max effort 慎用:Simon Willison 用「画一只骑自行车的鹈鹕 SVG」的固定测试跑 Opus 5.5,max thinking 档两次都没返回任何结果——耗尽 128K 输出上限仍在推理,每次花掉 $2.56、耗时近 20 分钟。他据此判断 max effort 在该场景「基本不可用」,但仍把 Opus 5.5 设为 Claude Code 默认模型。默认 effort 起步,别一上来就拉满。
- 冗长会吃掉降价红利:Artificial Analysis 测出它跑完智能指数共生成 2.6 亿 token,同类中位数仅 8800 万。token 单价降了,不代表账单一定降。
- 上下文窗口与最大输出未知:官方发布页未列这两个数(本站不填即为此原因)。第三方汇总按 1M 上下文描述 Claude Code 2.1.280 的接入口径,未获 Anthropic 官方文档确认,接入前请查 平台文档。
- 基准数字必须带 effort 档:表里的 66.4% 是 xhigh,正文里的 54.6% / 52.5% 是 medium,混用会被读者抓到不一致。
- 旧账户没有反蒸馏保护:preserved thinking 仅适用于 2026-08-31 之后创建的 API 账户。
- 不要把它当「最安全」代名词:官方明说它常怀疑自己在被评估,部署前评测的外推能力有限。
相关阅读
- 同门旗舰:Claude Fable 5.1 · Claude Sonnet 5 · Claude Opus 4.5
- 同日对手:GPT-6 Sol · GPT-6 Luna · GPT-6 Astra
- 搭载工具:Claude Code · Cline · Kiro · OpenRouter
- 概念:Terminal-Bench · Agentic Coding · Prompt Caching
- 资讯:Claude Opus 5.5 与 GPT-6 Sol/Luna 同日发布
来源
- Introducing Claude Opus 5.5(Anthropic 官方,2026-09-22)
- Opus 5.5 system card(Anthropic 官方)
- Claude Opus 5.5 平台文档(Anthropic,模型参数与 thinking 说明)
- Simon Willison 实测:Opus 5.5 max thinking 两次跑空(2026-09)
- Artificial Analysis 智能指数:Opus 5.5 列 212 款同类第一(2026-09)
- AI“减速”讨论未歇,OpenAI、Anthropic 同日上新(澎湃新闻,2026-09-23)
本卡片由 AI 之家 编辑部根据公开资料整理,非厂商付费内容。官方发布页未公开上下文窗口与最大输出 token,本卡不填该字段即为此原因;定价与基准以 Anthropic 官方页面为准,欢迎在 反馈邮箱 反馈更新。
Aider vs Claude Code:终端 AI 编程双雄怎么选
Aider vs Claude Code 2026 选型对比:开源 BYOK 多模型 vs Anthropic 订阅长任务 Agent,从编程能力、多模型支持、价格、Git 集成、国内可用性和适合人群判断,帮你选对终端 AI 编程工具。
Claude Code vs Cline:CLI AI Agent 怎么选?2026 对比
Claude Code vs Cline 2026 选型对比:Anthropic 官方闭源 CLI Agent vs Apache-2.0 开源 VS Code 插件。从模型绑定、工作流、MCP 支持、价格、隐私和适合人群 6 个维度帮你选对 CLI AI 编程工具。
Claude Code vs Codex CLI:终端 AI Agent 双雄对比
Claude Code vs Codex CLI 2026 选型对比:Anthropic 与 OpenAI 两大官方终端 Agent 的模型、长任务、MCP 生态、Windows 支持、订阅打包价格和国内可用性全方位对比,帮你判断该用哪个终端 AI Agent,以及能不能两个一起用。
Claude Code vs Crush:Anthropic 官方 vs 多模型 TUI(2026 实测选型)
Claude Code vs Crush 2026 选型对比:Anthropic 官方 CLI Agent(Claude only + 长任务最稳 + MCP 一等公民)vs Charmbracelet 开源 TUI Agent(多模型 mid-session 切换 + LSP + FSL-1.1-MIT)。从模型、长任务、生态、价格、国内可用性帮你选对终端 AI 编程工具。
Claude Code vs Gemini CLI:终端 AI Agent 怎么选?(2026 选型指南)
Claude Code 和 Gemini CLI 都是终端原生的 AI 编码 Agent。一句话结论 + 决策树 + 价格 + 国内可用性对比:长任务与 CLAUDE.md 生态选前者,免费额度与接入门槛选后者。
Cline vs Roo Code:同源衍生,2026 年该装哪个?
Cline 与 Roo Code 2026 选型对比:Roo Code 是 Cline 的衍生分支,增加了 Architect / Code / Ask 多种模式与更强的自定义能力。从产品形态、上手成本、长任务、成本可见性、计费方式与生态集成 6 个维度给出明确取舍。