跳到主内容
AIHO 2026 全新改版上线
codingAnthropic

Claude Opus 4.5

Anthropic 2025 年 11 月发布的旗舰模型,专为编程/agent/computer use 优化,SWE-bench Verified 发布即 SOTA,新增 effort 参数大幅降本。

规格

厂商
Anthropic
发布日期
2025/11/24
类型
coding
上下文窗口
200K tokens
最大输出
64K tokens
定价
Input $5/M · Output $25/M
API 兼容
anthropic, bedrock, vertex-ai

基准测试

SOTA(发布时)
SWE-bench Verified
较 Sonnet 4.5 +10.6%
Aider Polyglot
8 种语言中领先 7 种
SWE-bench Multilingual
较 Sonnet 4.5 +29%
Vending-Bench

✓ 优势

  • SWE-bench Verified 当时 SOTA,编程能力业界第一梯队
  • 新增 effort 参数:medium 档省 76% token 仍持平 Sonnet 4.5
  • 长程 agent 能力强,擅长多 subagent 编排
  • 号称最稳健对齐的前沿模型,抗提示注入强(Gray Swan 验证)
  • 上下文 compaction + 记忆能力,长任务不丢上下文

⚠ 不足

  • 价格偏高($5/$25),高吞吐场景成本压力大
  • 国内无官方 API,需走中转
  • 上下文 200K,低于 Gemini 3 Pro 的 1M
  • 纯多模态弱于 Gemini,仅支持图片

适用场景

软件工程 / 大型重构 agent深度研究与多步推理金融建模(Excel)多 subagent 编排任务

概述

Claude Opus 4.5 是 Anthropic 于 2025 年 11 月 24 日发布的旗舰模型(模型 ID claude-opus-4-5-20251101),专为编程、agentic 工作流和复杂 computer use 优化。发布时在 SWE-bench Verified 上达到 SOTA,是评测站高频对标的「编程能力天花板」。相比 Claude Sonnet 4.5,它在保持更强能力的同时通过 effort 参数大幅降低 token 消耗。

核心能力

编程 SOTA

  • SWE-bench Verified:发布时业界最高分
  • Aider Polyglot:较 Sonnet 4.5 提升 10.6%
  • SWE-bench Multilingual:8 种编程语言里领先 7 种

官方一个内部性能工程师 take-home 考试中,Opus 4.5 在 2 小时限时内的得分超过所有人类候选人。

effort 参数(降本关键)

Opus 4.5 新增 API effort 参数,在速度/成本和能力之间权衡:

effort 档位表现token 消耗
medium持平 Sonnet 4.5 的 SWE-bench比 Sonnet 4.5 少 76%
high超 Sonnet 4.5 4.3 个百分点少 48%

这意味着即便单价 $5/$25 偏高,实际账单因 token 消耗大幅下降而更可控。

长程 Agent 与编排

新增上下文 compaction 和记忆能力,长任务不丢上下文。擅长管理 subagent 团队——结合这些技术,官方深度研究评测提升近 15 个百分点。关于多 agent 编排的概念见 AI Agent

对齐与安全

Anthropic 称其为当前最稳健对齐的前沿模型。抗提示注入能力显著强于同业(Gray Swan 第三方验证),在人类误用和自主不当行为上的「问题行为」分数更低。

API 调用示例

import anthropic
client = anthropic.Anthropic(api_key="sk-ant-...")

msg = client.messages.create(
    model="claude-opus-4-5",
    max_tokens=8000,
    extra_body={"effort": "medium"},  # medium 省 76% token
    messages=[{"role": "user", "content": "重构这个模块并加类型注解"}],
)
print(msg.content[0].text)

定价

项目价格
Input$5 / 百万 token
Output$25 / 百万 token

比 Sonnet 4.5($3/$15)贵,但配合 effort=medium 的 token 节省,复杂任务实际成本常更低。Claude Code 用户已可直接用上。

与同档模型怎么选

维度Claude Opus 4.5Gemini 3 ProGPT-5.1-Codex-Max
纯编程(SWE-bench)SOTA76.2%77.9%
多模态仅图片原生全模态
上下文200K1M多窗口 compaction
agent 编排★★★★★★★★★☆★★★★★(专用)
国内可用

建议:综合编程 + agent 编排选 Opus 4.5;纯长程自动化编码任务可看专用的 GPT-5.1-Codex-Max;要多模态选 Gemini 3 Pro

避坑清单

  • 善用 effort 参数:默认别拉 high,medium 已能持平 Sonnet 4.5 且省 76% token。
  • 200K 上下文不是无限:超长 codebase 仍需配合 RAG 或检索压缩。
  • 国内无直连:需 Bedrock / Vertex AI 或中转。
  • 价格敏感场景算总账:单价高但 token 省,按实际任务估算而非只看单价。

实际使用体验

日常编码用 effort=medium 已经够打。在 Cursor/Claude Code 里跑中等规模重构(几百行级别、跨 3-5 个文件)时,medium 档的代码质量与 Sonnet 4.5 基本拉不开差距,但账单肉眼可见地降下来——一次会话原本 $0.4 左右能压到 $0.1 出头。只有遇到特别刁钻的边界条件、需要深度推理的 bug 时,切到 high 才有明显体感提升,日常没必要默认拉满。

长程 agent 任务是 Opus 4.5 真正拉开身位的地方。让它跑「读全仓 → 定位 → 改 → 自测」这种半小时以上的任务,compaction + 记忆能力的收益非常直观:中途上下文接近 200K 时会自动压缩关键信息,不会像早期模型那样在 100K 之后开始「失忆」或重复读同一文件。深度研究类任务(多轮检索 + 综合)能稳定跑完而不中途崩方向,这是 Sonnet 4.5 偶尔会翻车的场景。

多 subagent 编排在 Claude Code 里效果最明显。让 Opus 4.5 当主控拆任务、派给几个 subagent 并行跑(比如一个查依赖、一个写实现、一个补测试),主控对子任务结果的整合质量比 Sonnet 4.5 高一档——Sonnet 偶尔会把 subagent 的输出原样拼接而不真正融合,Opus 会重写冲突部分。不过编排本身有开销,简单任务别上多 agent,否则 overhead 吃掉收益。

和 Sonnet 4.5 的体感差距:日常 CRUD、改样式、写单测这种「确定性高」的活儿,两者几乎无差,Sonnet 性价比更高;真正拉开差距的是 30 分钟以上的长任务、需要跨多文件推理的重构、以及 agent 编排整合——这些场景 Opus 的稳定性明显更好。一句话总结:短任务用 Sonnet,长任务和编排用 Opus

FAQ

Q: Opus 4.5 和 Sonnet 4.5 怎么选? A: 看任务时长和复杂度。短任务(单文件改动、问答、补单测)选 Sonnet 4.5,性价比更高;30 分钟以上的长任务、跨多文件重构、需要 agent 编排的复杂场景选 Opus 4.5。预算紧且任务量大的团队,可以默认 Sonnet + Opus 兜底难任务的混合策略。

Q: effort 参数怎么选? A: 默认 medium 起步,它已能持平 Sonnet 4.5 的 SWE-bench 表现且省 76% token。只有遇到复杂推理、刁钻 bug、或对正确性要求极高的任务才升 high。不建议长期挂 high,token 消耗会涨 3-4 倍,收益却未必线性。

Q: 国内怎么用 Claude Opus 4.5? A: 官方 API 不对国内直供,常见三条路:① AWS Bedrock(需海外账号 + 信用卡);② Google Vertex AI;③ 第三方中转 API(如 OpenRouter)。稳定性排序 Bedrock > Vertex > 中转,成本排序反之。个人尝鲜选中转,生产环境建议 Bedrock/Vertex。

Q: 200K 上下文够用吗? A: 多数场景够,但不是无限。配合 compaction 和记忆能力,单次会话能撑住中型 codebase 的全量读取 + 多轮修改;超大型 monorepo(百万行级)仍需配合 RAG 或按目录分片检索。和 Gemini 3 Pro 的 1M 上下文比,Opus 靠 compaction 补了一部分差距,但一次性塞入能力确实弱一些。

延伸阅读