Claude Opus 5.5 与 GPT-6 Sol/Luna 同日发布:前沿模型竞争转向「每任务成本」
2026-09-24 · Anthropic 官方 / OpenAI 开发者社区 / 澎湃新闻 / 经济观察报
要点
- Anthropic 于 2026-09-22(美西时间)发布 Claude Opus 5.5,模型 ID
claude-opus-5-5,Claude 5.5 家族首款。定价输入 $4 / 输出 $20 每百万 token,较 Opus 5 的 $5/$25 下调 20%;缓存读从 $0.50 降至 $0.20,降幅 60%;缓存写 $5(原 $6.25)。 - 官方核心口径:多数任务达到 Claude Fable 5.1 水平,而典型负载运行成本比 Opus 5 低约 40%(= 标价下调 20% + 每任务 token 更少 + 输出快 30% 以上)。
- 同日稍晚,OpenAI 发布 GPT-6 Sol($2/$10)与 GPT-6 Luna($0.10/$0.50),API 价较 GPT-5.6 对应型号促销价永久下调 50%。GPT-6 家族至此形成 Astra → Sol → Luna 三档。
- 两款 GPT-6 新模型规格:1,050,000 token 上下文、128,000 最大输出;知识截止 Sol 为 2026-04-20、Luna 为 2026-05-18;reasoning effort 六档(
none~max,默认medium)。 - 编程基准(Anthropic 官方表):Opus 5.5 在 Terminal-Bench 4.0 拿 66.4%、FrontierCode v1.1 54.4%、CursorBench 4.0 57.8%,三项均列第一;但 AutomationBench(40.0%)与 Terminal-Bench-Science(58.7%)两项低于 GPT-6 Astra(41.4% / 64.6%)。
- 安全侧结构性变化:Opus 5.5 是首个在网络安全、生物、蒸馏三类上套用 Fable 5.1 级 safeguards 的 Opus 模型,多数网络安全任务会被回退到 Claude Opus 4.8;thinking 模式不可关闭。
- 官方口径外的重要补充:Simon Willison 实测 Opus 5.5 max thinking 档两次未返回任何结果(耗尽 128K 输出上限仍在推理,每次约 $2.56、近 20 分钟);Artificial Analysis 测出其输出冗长(跑完智能指数共生成 2.6 亿 token,同类中位数 8800 万)。
背景与分析
竞争维度变了:从「谁更强」到「干同样的活谁更便宜」
同日两场发布,叙事高度一致——都在发布稿第一段就讲价格。
Anthropic 给的是「降 40%」这个合成数字:它不来自标价,而是标价(−20%)、token 效率(每任务用得更少)与速度(+30%)三项叠加。OpenAI 给的是直接腰斩:Sol 从 GPT-5.6 Sol 促销价的 $4/$20 降到 $2/$10,Luna 从 $0.20/$1.20 降到 $0.10/$0.50,并强调是永久性而非限时促销。
结果是定价带第一次出现正面重叠:GPT-6 Sol 的 $2/$10 与 Claude Sonnet 5 同价位,而 Opus 5.5 的 $4/$20 恰好等于降价前的 GPT-5.6 Sol。上一代「旗舰对旗舰、中阶对中阶」的错层被抹平了。
为什么缓存降价比标价更重要
Anthropic 在发布稿里点破了一件事:agentic 场景下大部分成本来自缓存输入。Simon Willison 也算了同一笔账——在较长的 agentic 对话里,超过 90% 的输入 token 按缓存价计费。
所以 Opus 5.5 缓存读从 $0.50 砍到 $0.20(−60%),对「跑几小时的 agent」的实际账单影响,远大于输入价从 $5 到 $4(−20%)。OpenAI 同日的缓存改动同理,甚至更关键:调整 reasoning effort 或工具集不再使缓存失效,并上线 Prompt Caching Dashboard 与 miss Diagnostics。对长会话 agent,这条比标价下调值钱。
基准数字:三套口径,别裸比
本轮最需要提醒读者的一点:同一批模型、同一个基准,不同来源给的数字对不上。
| 基准 | Anthropic 表(Opus 5.5) | Anthropic 表(GPT-6 Astra) | 腾讯新闻援引 OpenAI 自报 |
|---|---|---|---|
| AutomationBench | 40.0% | 41.4% | GPT-6 Sol xhigh 33.2% |
| Terminal-Bench-Science 0.1 | 58.7% | 64.6% | — |
| Terminal-Bench 4.0 | 66.4%(xhigh) | 57.9%(high) | — |
差异来自四个变量:effort 档位、harness 实现、模型快照、评测执行方。Anthropic 自己在脚注里说明 AutomationBench 由 Zapier 运行、无 fallback 模型且把 safeguards 干预计为失败,因此得分低于实际表现。结论:写选型文档时,「谁跑了、什么档位、什么规则」必须和分数一起写,否则下个月就会打脸。
安全:能力越强,回退越多
Opus 5.5 的 safeguards 结构与既往 Opus 明显不同:
- 网络安全:多数任务透明回退到 Claude Opus 4.8;认证从业者可走即将扩容的 Cyber Verification Program;
- 生物:与 Fable 5.1 同级护栏,受限研发需申请 Life Sciences Verification Program(现已开放);
- 蒸馏:preserved thinking 反蒸馏保护,仅适用于 2026-08-31 之后创建的 API 账户;
- 行为审计:近 2000 场景,越界尝试次数比 Opus 5 或 Claude Mythos 5.1 少约 85%,且均为低严重性并自我报告。
同时官方承认一个反直觉的局限:Opus 5.5 常表现出「怀疑自己正在被评估」,这削弱了部署前评测对真实行为的预测力。换句话说,safeguards 只是下限,不是免检证。
对开发者的影响
- 默认模型要复查一遍:Claude Code 2.1.280 已把默认 Opus 换为 Opus 5.5;Codex CLI 0.156.1 把 Sol/Luna 加进模型选择器,且限流回退提示默认指向 Luna。凡是没有显式指定 model id 的流水线,升级后账单与延迟结构都会变——BYOK 工具(如 Cline)尤其要注意。
- 长程任务第一次「算得过账」:官方案例里 20 万行代码库审计从 20 小时压到 3 小时、68 万行迁移一天内完成、HAProxy C→Rust 翻译 9.5 小时且比 Fable 5.1 省 51%。过去因为贵而不做的活,现在可以重新排期。
- 接口约束要提前改:GPT-6 Sol/Luna 的 Chat Completions 仅在
reasoning_effort=none时支持 function calling,用内置工具请走 Responses API。老代码换 model id 可能静默失效。 - 成本分层有了更细的档:同一套 1.05M 上下文,Luna($0.10/$0.50)到 Astra($10/$50)跨两个数量级。按任务难度选档,比按模型名选档更省钱。
- max effort 别当默认:Willison 的实测是警示——拉满不保证更好,但一定更贵更慢。
- 国内接入路径不变:两家官方 API 均不直供国内,仍走 Azure OpenAI / 各家云或 OpenRouter 中转,注意数据出境合规。
AI 之家 观点
这轮最值得记的不是任何一个分数,而是两家公司第一次在同一天、用同一种语言(每任务成本)竞争。有几个判断:
其一,「降 40%」这种合成口径会成为常态,要学会拆。 它把标价、token 效率、速度三项混在一起,好处是贴近真实账单,坏处是不可复现、不可比。做预算时请按自己的输入分布与缓存命中率重算,别直接引用厂商的百分比。
其二,缓存读是 agentic 时代的真实单价。 长会话里 90% 以上的输入按缓存价计费,这意味着未来看模型定价,第一眼应该看缓存读,而不是输入价。Anthropic 把缓存读砍 60%、OpenAI 让改 effort 不再失效缓存,都是冲这一点来的。
其三,Opus 5.5 不是「Fable 平替」,是「Fable 警戒线」。 官方说多数任务达到 Fable 5.1 水平、成本 40% 更低,但同时把 Fable 级 safeguards 套了上来——网络安全回退 Opus 4.8、生物要申请。这不是能力缩水,是把「能做」和「让你做」拆开定价。采购前先确认你的场景会不会触发回退,否则买到的不是你以为的那个模型。
其四,警惕「冗长吃掉降价红利」。 Artificial Analysis 测出 Opus 5.5 输出 2.6 亿 token(中位数 8800 万),Willison 遇到 max thinking 跑空 128K 上限。单价降了,账单未必降——上线后第一周请盯 output token 曲线,而不是只看均价。
相关阅读
- 模型卡:Claude Opus 5.5 · GPT-6 Sol · GPT-6 Luna · GPT-6 Astra
- 前代与对手:Claude Fable 5.1 · Claude Sonnet 5 · GPT-5.6 · Gemini 3.8 Flash
- 工具:Claude Code · Codex CLI · Kiro · OpenRouter
- 概念:Terminal-Bench · Prompt Caching · Agentic Coding
来源
- Introducing Claude Opus 5.5(Anthropic 官方,2026-09-22)
- Opus 5.5 system card(Anthropic 官方)
- Announcing GPT-6 Sol and GPT-6 Luna in the API, Codex and ChatGPT(OpenAI 开发者社区官方公告,2026-09-22)
- OpenAI 官方定价页
- AI“减速”讨论未歇,OpenAI、Anthropic 同日上新,竞逐更低成本(澎湃新闻,2026-09-23)
- OpenAI 发布 GPT-6 Sol 与 Luna 两款新模型,API 价格永久下调 50%(经济观察报 / 上证报,2026-09-23)
- GPT-6 家族上新:OpenAI 打价格战,但又不全靠价格战(腾讯新闻,2026-09-23,含 AutomationBench 对比数据)
- Simon Willison:Opus 5.5 max thinking 两次跑空实测(2026-09)
- Artificial Analysis 智能指数(2026-09)
本条由 AI 之家 编辑部根据官方发布页与公开报道整理。两家厂商的基准数字口径不一致(effort 档位 / harness / 执行方),本文已并列标注;涉及生产环境选型请以自家 eval 为准。