Anthropic 发布 Claude Sonnet 5:中端逼近旗舰,SWE-bench Verified 85.2%
2026-06-30 · Anthropic
要点
- model ID
claude-sonnet-5,1M 上下文,128K 输出(batch beta 可到 300K),知识截止 2026-01 - SWE-bench Verified 85.2%、SWE-bench Pro 63.2%、Terminal-Bench 2.1 80.4%、OSWorld-Verified 81.2%
- 成为 claude.ai Free & Pro 默认模型,旗舰 Opus 退居"复杂任务才调用"
- 定价:促销 $2/$10(cache $0.20)至 2026-08-31,之后标准 $3/$15
- 已上线 Claude Code / Anthropic API / Cursor / VS Code / GitHub Copilot
- 默认开启 adaptive thinking;新分词器令同文本 token 数约 +30%
一次"中端革命"
Anthropic 做了件反直觉的事:把一款定位"中端"的 Sonnet 5 推到最前台,成为覆盖免费到企业所有层级的默认模型,而旗舰 Opus 4.8 退居幕后。
这背后的信号很清楚——竞争逻辑正从"谁的模型最强"转向"谁能在日常高频工作流里跑得久、花得少"。数据支撑了这个判断:
| 基准 | Sonnet 4.6 | Sonnet 5 | Opus 4.8 |
|---|---|---|---|
| SWE-bench Pro | 58.1% | 63.2% | 69.2% |
| OSWorld-Verified | 78.5% | 81.2% | 83.4% |
| GDPval-AA v2(知识工作) | 1395 | 1618 | 1615 |
一代迭代把与旗舰的差距从 11 个百分点压到 6 个,在 GDPval-AA v2 知识工作基准上甚至以微弱优势反超 Opus 4.8。
定价里的隐藏成本
促销期 $2/$10 确实便宜,但要注意 Sonnet 5 换了新分词器,同样的文本会多出约 30% token。也就是说单价降了,但每个任务的实际 token 消耗上升,真实成本没有账面那么低。促销 8-31 结束后回到 $3/$15,重度用户要重新算账。
对编程工具的连锁反应
Sonnet 5 一发布就成了 Cursor、Claude Code、VS Code、Copilot 的可选/默认模型。对大多数在这些工具里干活的开发者来说,"默认模型"从 Sonnet 4.x 悄悄换成了 Sonnet 5——多步变更的可靠性、遵守规范的能力都有可感知的提升。
AIHO 观点
Sonnet 5 是 2026 年"性价比战"的代表作:用 60% 的价格拿到接近旗舰的能力。对绝大多数团队,它就是新的默认选择,只在架构级难题上才需要切 Opus 4.8。唯一要盯紧的是分词器变化带来的隐性 token 成本——把它计入你的月度预算再决定用量。