跳到主内容
AIHO 2026 全新改版上线

Anthropic 发布 Claude Sonnet 5:中端逼近旗舰,SWE-bench Verified 85.2%

2026-06-30 · Anthropic

要点

  • model ID claude-sonnet-51M 上下文,128K 输出(batch beta 可到 300K),知识截止 2026-01
  • SWE-bench Verified 85.2%、SWE-bench Pro 63.2%、Terminal-Bench 2.1 80.4%、OSWorld-Verified 81.2%
  • 成为 claude.ai Free & Pro 默认模型,旗舰 Opus 退居"复杂任务才调用"
  • 定价:促销 $2/$10(cache $0.20)至 2026-08-31,之后标准 $3/$15
  • 已上线 Claude Code / Anthropic API / Cursor / VS Code / GitHub Copilot
  • 默认开启 adaptive thinking;新分词器令同文本 token 数约 +30%

一次"中端革命"

Anthropic 做了件反直觉的事:把一款定位"中端"的 Sonnet 5 推到最前台,成为覆盖免费到企业所有层级的默认模型,而旗舰 Opus 4.8 退居幕后。

这背后的信号很清楚——竞争逻辑正从"谁的模型最强"转向"谁能在日常高频工作流里跑得久、花得少"。数据支撑了这个判断:

基准Sonnet 4.6Sonnet 5Opus 4.8
SWE-bench Pro58.1%63.2%69.2%
OSWorld-Verified78.5%81.2%83.4%
GDPval-AA v2(知识工作)139516181615

一代迭代把与旗舰的差距从 11 个百分点压到 6 个,在 GDPval-AA v2 知识工作基准上甚至以微弱优势反超 Opus 4.8。

定价里的隐藏成本

促销期 $2/$10 确实便宜,但要注意 Sonnet 5 换了新分词器,同样的文本会多出约 30% token。也就是说单价降了,但每个任务的实际 token 消耗上升,真实成本没有账面那么低。促销 8-31 结束后回到 $3/$15,重度用户要重新算账。

对编程工具的连锁反应

Sonnet 5 一发布就成了 Cursor、Claude Code、VS Code、Copilot 的可选/默认模型。对大多数在这些工具里干活的开发者来说,"默认模型"从 Sonnet 4.x 悄悄换成了 Sonnet 5——多步变更的可靠性、遵守规范的能力都有可感知的提升。

AIHO 观点

Sonnet 5 是 2026 年"性价比战"的代表作:用 60% 的价格拿到接近旗舰的能力。对绝大多数团队,它就是新的默认选择,只在架构级难题上才需要切 Opus 4.8。唯一要盯紧的是分词器变化带来的隐性 token 成本——把它计入你的月度预算再决定用量。

相关阅读