跳到主内容

Anthropic 发布 Claude Sonnet 5:中端逼近旗舰,SWE-bench Verified 85.2%

2026-06-30 · Anthropic

要点

  • model ID claude-sonnet-51M 上下文,128K 输出(batch beta 可到 300K),知识截止 2026-01
  • SWE-bench Verified 85.2%、SWE-bench Pro 63.2%、Terminal-Bench 2.1 80.4%、OSWorld-Verified 81.2%
  • 成为 claude.ai Free & Pro 默认模型,旗舰 Opus 退居"复杂任务才调用"
  • 定价:促销 $2/$10(cache $0.20)至 2026-08-31,之后标准 $3/$15
  • 已上线 Claude Code / Anthropic API / Cursor / VS Code / GitHub Copilot
  • 默认开启 adaptive thinking;新分词器令同文本 token 数约 +30%

一次"中端革命"

Anthropic 做了件反直觉的事:把一款定位"中端"的 Sonnet 5 推到最前台,成为覆盖免费到企业所有层级的默认模型,而旗舰 Opus 4.8 退居幕后。

这背后的信号很清楚——竞争逻辑正从"谁的模型最强"转向"谁能在日常高频工作流里跑得久、花得少"。数据支撑了这个判断:

基准Sonnet 4.6Sonnet 5Opus 4.8
SWE-bench Pro58.1%63.2%69.2%
OSWorld-Verified78.5%81.2%83.4%
GDPval-AA v2(知识工作)139516181615

一代迭代把与旗舰的差距从 11 个百分点压到 6 个,在 GDPval-AA v2 知识工作基准上甚至以微弱优势反超 Opus 4.8。

背景上下文

Anthropic 的模型策略在 2026 年发生了一个微妙转向。此前 Opus 系列一直是"旗舰标杆",承担与 GPT-5.x Sol 正面对标的角色。但企业客户的反馈很一致:日常工作中 90% 的任务用不到 Opus 的能力上限,却要为 Opus 的价格买单。与此同时,GPT-5.6 的三档分层(Sol/Terra/Luna)和 DeepSeek V4 的低价策略,正在把"中端价位"变成竞争最激烈的区间。

Sonnet 5 的发布正是 Anthropic 对这一趋势的回应——用一款"中端价格、接近旗舰能力"的模型占据默认位,让 Opus 退居"真正需要时才调用"的特种角色。这也意味着 Anthropic 在定价策略上从"旗舰驱动"转向"默认模型驱动",用 Sonnet 5 的量来弥补单价下降。

从产品节奏看,Sonnet 5 发布于 GPT-5.6 GA 前一周,抢了个时间差——让开发者先在 Claude Code 里用上 Sonnet 5,再决定是否转向 GPT-5.6。

技术细节

Sonnet 5 的能力跃升来自几个关键技术选择:

  • adaptive thinking 默认开启:模型可根据任务复杂度自动决定是否进入深度推理模式。简单补全不触发 reasoning,复杂调试自动拉长思考链。这比 Sonnet 4.6 的"手动开关 reasoning"更平滑,也省 token。
  • 新分词器:Anthropic 为 Sonnet 5 引入了全新分词器,对中英文混合代码场景的压缩率更高。但副作用是同一段文本的 token 数较旧分词器增加约 30%——这直接影响账单。
  • 128K 输出 / 300K batch:单次输出上限 128K token,batch 模式 beta 可到 300K。这对"一次性生成大型文件"或"批量处理"场景非常友好,减少多轮往返。
  • 1M 上下文 + 知识截止 2026-01:上下文窗口与 Opus 4.8 持平,知识截止更新到 2026 年 1 月,覆盖了 2025 年下半年到 2026 年初的主要技术进展。
  • 训练方法:Anthropic 披露 Sonnet 5 采用了改进的 Constitutional AI 与更大规模的代码 RLHF,尤其在"多步变更的可靠性"和"遵守项目规范"上做了针对性强化。

定价里的隐藏成本

促销期 $2/$10 确实便宜,但要注意 Sonnet 5 换了新分词器,同样的文本会多出约 30% token。也就是说单价降了,但每个任务的实际 token 消耗上升,真实成本没有账面那么低。促销 8-31 结束后回到 $3/$15,重度用户要重新算账。

粗略估算:假设一个任务在 Sonnet 4.6 下消耗 10K input + 2K output token,费用约 $0.09。在 Sonnet 5 促销期下,同任务约 13K input + 2.6K output token,费用约 $0.052——确实更便宜。但促销结束后($3/$15),同任务费用约 $0.078,与 Sonnet 4.6 的差距就没那么大了。

对编程工具的连锁反应

Sonnet 5 一发布就成了 Cursor、Claude Code、VS Code、Copilot 的可选/默认模型。对大多数在这些工具里干活的开发者来说,"默认模型"从 Sonnet 4.x 悄悄换成了 Sonnet 5——多步变更的可靠性、遵守规范的能力都有可感知的提升。

尤其值得注意的是 Claude Code:作为 Anthropic 自家的 CLI Agent,Claude Code 在 Sonnet 5 上线后立即将其设为默认,且官方明确表示 Sonnet 5 在"长链工具调用"场景下的表现是"代际提升"。这对 Cursor 的默认模型地位构成了直接压力——如果 Claude Code + Sonnet 5 的组合足够好且更便宜,部分用户会从 Cursor 迁移。

行业影响

Sonnet 5 的发布进一步压缩了"中端模型"的定义空间。当一款中端模型在 SWE-bench Verified 上达到 85.2%(一年前这是旗舰水平),它实际上在重新定义"够用"的标准:

  • 对 GPT-5.6 Terra 的直接竞争:Terra 定价 $2.50/$15,Sonnet 5 促销期 $2/$10、标准 $3/$15,两者几乎在同一价位段正面交锋。
  • 对 DeepSeek V4 Pro 的压制:V4 Pro 便宜得多,但能力差距在复杂代码场景会更明显。Sonnet 5 让"贵一点但靠谱"成为一个合理选择。
  • 加速 Opus 的"特种化":当 Sonnet 5 在多数场景已接近 Opus,Opus 4.8 的价值会越来越集中在"Sonnet 5 搞不定的硬骨头"上,这反而强化了 Anthropic 的分层定价逻辑。

AI 之家 观点

Sonnet 5 是 2026 年"性价比战"的代表作:用 60% 的价格拿到接近旗舰的能力。对绝大多数团队,它就是新的默认选择,只在架构级难题上才需要切 Opus 4.8。唯一要盯紧的是分词器变化带来的隐性 token 成本——把它计入你的月度预算再决定用量。

实操建议:先用 Sonnet 5 跑两周你的真实工作流,记录实际 token 消耗与任务成功率,再决定是否从 Sonnet 4.x / GPT-5.6 Terra 全面切换。促销期内不妨多跑一些积压的重活,把便宜的窗口期用足。

相关阅读