跳到主内容

Claude Opus 5.5 与 GPT-6 Sol/Luna 同日发布:前沿模型竞争转向「每任务成本」

2026-09-24 · Anthropic 官方 / OpenAI 开发者社区 / 澎湃新闻 / 经济观察报

要点

  • Anthropic 于 2026-09-22(美西时间)发布 Claude Opus 5.5,模型 ID claude-opus-5-5,Claude 5.5 家族首款。定价输入 $4 / 输出 $20 每百万 token,较 Opus 5 的 $5/$25 下调 20%;缓存读从 $0.50 降至 $0.20,降幅 60%;缓存写 $5(原 $6.25)。
  • 官方核心口径:多数任务达到 Claude Fable 5.1 水平,而典型负载运行成本比 Opus 5 低约 40%(= 标价下调 20% + 每任务 token 更少 + 输出快 30% 以上)。
  • 同日稍晚,OpenAI 发布 GPT-6 Sol($2/$10)与 GPT-6 Luna($0.10/$0.50),API 价较 GPT-5.6 对应型号促销价永久下调 50%。GPT-6 家族至此形成 Astra → Sol → Luna 三档。
  • 两款 GPT-6 新模型规格:1,050,000 token 上下文、128,000 最大输出;知识截止 Sol 为 2026-04-20、Luna 为 2026-05-18;reasoning effort 六档(none~max,默认 medium)。
  • 编程基准(Anthropic 官方表):Opus 5.5 在 Terminal-Bench 4.0 拿 66.4%、FrontierCode v1.1 54.4%、CursorBench 4.0 57.8%,三项均列第一;但 AutomationBench(40.0%)与 Terminal-Bench-Science(58.7%)两项低于 GPT-6 Astra(41.4% / 64.6%)。
  • 安全侧结构性变化:Opus 5.5 是首个在网络安全、生物、蒸馏三类上套用 Fable 5.1 级 safeguards 的 Opus 模型,多数网络安全任务会被回退到 Claude Opus 4.8;thinking 模式不可关闭。
  • 官方口径外的重要补充:Simon Willison 实测 Opus 5.5 max thinking 档两次未返回任何结果(耗尽 128K 输出上限仍在推理,每次约 $2.56、近 20 分钟);Artificial Analysis 测出其输出冗长(跑完智能指数共生成 2.6 亿 token,同类中位数 8800 万)。

背景与分析

竞争维度变了:从「谁更强」到「干同样的活谁更便宜」

同日两场发布,叙事高度一致——都在发布稿第一段就讲价格。

Anthropic 给的是「降 40%」这个合成数字:它不来自标价,而是标价(−20%)、token 效率(每任务用得更少)与速度(+30%)三项叠加。OpenAI 给的是直接腰斩:Sol 从 GPT-5.6 Sol 促销价的 $4/$20 降到 $2/$10,Luna 从 $0.20/$1.20 降到 $0.10/$0.50,并强调是永久性而非限时促销。

结果是定价带第一次出现正面重叠:GPT-6 Sol 的 $2/$10 与 Claude Sonnet 5 同价位,而 Opus 5.5 的 $4/$20 恰好等于降价前的 GPT-5.6 Sol。上一代「旗舰对旗舰、中阶对中阶」的错层被抹平了。

为什么缓存降价比标价更重要

Anthropic 在发布稿里点破了一件事:agentic 场景下大部分成本来自缓存输入。Simon Willison 也算了同一笔账——在较长的 agentic 对话里,超过 90% 的输入 token 按缓存价计费。

所以 Opus 5.5 缓存读从 $0.50 砍到 $0.20(−60%),对「跑几小时的 agent」的实际账单影响,远大于输入价从 $5 到 $4(−20%)。OpenAI 同日的缓存改动同理,甚至更关键:调整 reasoning effort 或工具集不再使缓存失效,并上线 Prompt Caching Dashboard 与 miss Diagnostics。对长会话 agent,这条比标价下调值钱。

基准数字:三套口径,别裸比

本轮最需要提醒读者的一点:同一批模型、同一个基准,不同来源给的数字对不上。

基准Anthropic 表(Opus 5.5)Anthropic 表(GPT-6 Astra)腾讯新闻援引 OpenAI 自报
AutomationBench40.0%41.4%GPT-6 Sol xhigh 33.2%
Terminal-Bench-Science 0.158.7%64.6%—
Terminal-Bench 4.066.4%(xhigh)57.9%(high)—

差异来自四个变量:effort 档位、harness 实现、模型快照、评测执行方。Anthropic 自己在脚注里说明 AutomationBench 由 Zapier 运行、无 fallback 模型且把 safeguards 干预计为失败,因此得分低于实际表现。结论:写选型文档时,「谁跑了、什么档位、什么规则」必须和分数一起写,否则下个月就会打脸。

安全:能力越强,回退越多

Opus 5.5 的 safeguards 结构与既往 Opus 明显不同:

  • 网络安全:多数任务透明回退到 Claude Opus 4.8;认证从业者可走即将扩容的 Cyber Verification Program;
  • 生物:与 Fable 5.1 同级护栏,受限研发需申请 Life Sciences Verification Program(现已开放);
  • 蒸馏:preserved thinking 反蒸馏保护,仅适用于 2026-08-31 之后创建的 API 账户;
  • 行为审计:近 2000 场景,越界尝试次数比 Opus 5 或 Claude Mythos 5.1 少约 85%,且均为低严重性并自我报告。

同时官方承认一个反直觉的局限:Opus 5.5 常表现出「怀疑自己正在被评估」,这削弱了部署前评测对真实行为的预测力。换句话说,safeguards 只是下限,不是免检证。

对开发者的影响

  1. 默认模型要复查一遍:Claude Code 2.1.280 已把默认 Opus 换为 Opus 5.5;Codex CLI 0.156.1 把 Sol/Luna 加进模型选择器,且限流回退提示默认指向 Luna。凡是没有显式指定 model id 的流水线,升级后账单与延迟结构都会变——BYOK 工具(如 Cline)尤其要注意。
  2. 长程任务第一次「算得过账」:官方案例里 20 万行代码库审计从 20 小时压到 3 小时、68 万行迁移一天内完成、HAProxy C→Rust 翻译 9.5 小时且比 Fable 5.1 省 51%。过去因为贵而不做的活,现在可以重新排期。
  3. 接口约束要提前改:GPT-6 Sol/Luna 的 Chat Completions 仅在 reasoning_effort=none 时支持 function calling,用内置工具请走 Responses API。老代码换 model id 可能静默失效。
  4. 成本分层有了更细的档:同一套 1.05M 上下文,Luna($0.10/$0.50)到 Astra($10/$50)跨两个数量级。按任务难度选档,比按模型名选档更省钱。
  5. max effort 别当默认:Willison 的实测是警示——拉满不保证更好,但一定更贵更慢。
  6. 国内接入路径不变:两家官方 API 均不直供国内,仍走 Azure OpenAI / 各家云或 OpenRouter 中转,注意数据出境合规。

AI 之家 观点

这轮最值得记的不是任何一个分数,而是两家公司第一次在同一天、用同一种语言(每任务成本)竞争。有几个判断:

其一,「降 40%」这种合成口径会成为常态,要学会拆。 它把标价、token 效率、速度三项混在一起,好处是贴近真实账单,坏处是不可复现、不可比。做预算时请按自己的输入分布与缓存命中率重算,别直接引用厂商的百分比。

其二,缓存读是 agentic 时代的真实单价。 长会话里 90% 以上的输入按缓存价计费,这意味着未来看模型定价,第一眼应该看缓存读,而不是输入价。Anthropic 把缓存读砍 60%、OpenAI 让改 effort 不再失效缓存,都是冲这一点来的。

其三,Opus 5.5 不是「Fable 平替」,是「Fable 警戒线」。 官方说多数任务达到 Fable 5.1 水平、成本 40% 更低,但同时把 Fable 级 safeguards 套了上来——网络安全回退 Opus 4.8、生物要申请。这不是能力缩水,是把「能做」和「让你做」拆开定价。采购前先确认你的场景会不会触发回退,否则买到的不是你以为的那个模型。

其四,警惕「冗长吃掉降价红利」。 Artificial Analysis 测出 Opus 5.5 输出 2.6 亿 token(中位数 8800 万),Willison 遇到 max thinking 跑空 128K 上限。单价降了,账单未必降——上线后第一周请盯 output token 曲线,而不是只看均价。

相关阅读

来源

本条由 AI 之家 编辑部根据官方发布页与公开报道整理。两家厂商的基准数字口径不一致(effort 档位 / harness / 执行方),本文已并列标注;涉及生产环境选型请以自家 eval 为准。

相关对比

Aider vs Claude Code:终端 AI 编程双雄怎么选

Aider vs Claude Code 2026 选型对比:开源 BYOK 多模型 vs Anthropic 订阅长任务 Agent,从编程能力、多模型支持、价格、Git 集成、国内可用性和适合人群判断,帮你选对终端 AI 编程工具。

Claude Code vs Cline:CLI AI Agent 怎么选?2026 对比

Claude Code vs Cline 2026 选型对比:Anthropic 官方闭源 CLI Agent vs Apache-2.0 开源 VS Code 插件。从模型绑定、工作流、MCP 支持、价格、隐私和适合人群 6 个维度帮你选对 CLI AI 编程工具。

Claude Code vs Codex CLI:终端 AI Agent 双雄对比

Claude Code vs Codex CLI 2026 选型对比:Anthropic 与 OpenAI 两大官方终端 Agent 的模型、长任务、MCP 生态、Windows 支持、订阅打包价格和国内可用性全方位对比,帮你判断该用哪个终端 AI Agent,以及能不能两个一起用。

Claude Code vs Crush:Anthropic 官方 vs 多模型 TUI(2026 实测选型)

Claude Code vs Crush 2026 选型对比:Anthropic 官方 CLI Agent(Claude only + 长任务最稳 + MCP 一等公民)vs Charmbracelet 开源 TUI Agent(多模型 mid-session 切换 + LSP + FSL-1.1-MIT)。从模型、长任务、生态、价格、国内可用性帮你选对终端 AI 编程工具。

Claude Code vs Gemini CLI:终端 AI Agent 怎么选?(2026 选型指南)

Claude Code 和 Gemini CLI 都是终端原生的 AI 编码 Agent。一句话结论 + 决策树 + 价格 + 国内可用性对比:长任务与 CLAUDE.md 生态选前者,免费额度与接入门槛选后者。

Codex CLI vs Crush:OpenAI 官方 vs 多模型 TUI(2026 实测选型)

Codex CLI vs Crush 2026 选型对比:OpenAI 官方终端 Coding Agent(GPT-5.6 + Windows 原生沙箱 + Apache-2.0)vs Charmbracelet 开源 TUI Agent(多模型 mid-session 切换 + LSP + FSL-1.1-MIT)。从模型、平台、生态、价格、国内可用性帮你选对终端 AI 编程工具。

相关评测