跳到主内容

Claude Haiku 5.5 发布:1M 上下文、最低 $0.10/$0.50,Anthropic 把轻量档价格砍到 Luna 同价

Anthropic 于 2026-10-07 发布 Claude Haiku 5.5:1M 上下文、128K 输出,≤100K token 时 $0.10/$0.50,官方称平均比 Haiku 4.5 便宜约 75%;同日 Sonnet 5.5 缓存读价减半至 $0.10。

2026-10-08 · Anthropic 官方发布页 / Claude Code 官方 CHANGELOG(GitHub)

发布 2026-10-08核实 2026-10-08

Claude Haiku 5.5 发布 · 要点速览

  • Anthropic 于 2026-10-07 发布 Claude Haiku 5.5,模型 ID claude-haiku-5-5,即日成为 Anthropic API 上的默认 Haiku 模型。这是 Claude 5.5 家族的第三款,也是最后一款——Opus 5.5 于 2026-09-22、Sonnet 5.5 于 2026-09-28 发布,三档换代至此收官。
  • 上下文从 200K 跳到 1M:上一代 Haiku 4.5 是 200K 上下文 / 64K 输出,Haiku 5.5 是 1M 上下文 / 128K 输出——上下文是 5 倍,输出上限是 2 倍。
  • 定价按提示长度分两档(每百万 token):≤100K token 时输入 $0.10 / 输出 $0.50;>100K token 时输入 $0.50 / 输出 $2.50。
  • 官方称平均运行成本比 Haiku 4.5 低约 75%。依据是发布页脚注:≤100K 档标价降 90%、>100K 档降 50%,而 Haiku 4.5 约九成请求落在低价档;同时官方提醒 Haiku 5.5 换用了与 Sonnet/Opus 5.5 相同的新 tokenizer,完成同样的工作会略多用一些 token。
  • 首个带可调 effort 的 Haiku 档:官方称 Haiku 5.5 是该系列第一个支持 adjustable effort 的型号,可以在同一模型上按「省钱」或「要质量」调节,而不必跨档换模型。
  • 发布当天即上线全部平台:Claude 官方订阅体系、Claude Code、Claude Platform(API),以及 AWS、Google Cloud、Microsoft Azure 三家云。
  • 同日两件附带变更:① Sonnet 5.5 的缓存读价从 $0.20 降到 $0.10(−50%),官方称这会让 Sonnet 5.5 在多数 agentic 任务上的成本再降约 20%;② Claude Python 与 TypeScript SDK 新增 computer use / browser use(beta) 支持。
  • 同日 Claude Code 发布 v2.1.293(据 GitHub Releases 的 tag 时间 2026-10-07T18:10:20Z),其官方 CHANGELOG 首条即为 「Added Claude Haiku 5.5 (claude-haiku-5-5), now the default Haiku model on the Anthropic API」,与发布页口径一致。

定价:为什么「分档」这件事值得单独讲

Haiku 5.5 的定价表有一个此前 Haiku 档没有的结构——按输入长度分档:

项≤100K token>100K tokenHaiku 4.5(对照)
输入$0.10$0.50$1.00
输出$0.50$2.50$5.00
缓存读$0.01$0.05$0.10
缓存写(5 分钟)$0.125$0.625$1.25
缓存写(1 小时)$0.20$1.00—

(单位:美元 / 每百万 token。来源:Anthropic 官方 Haiku 5.5 发布页定价表。)

这张表最该看的是缓存读那一列的量级差:Haiku 5.5 在低档的缓存读是 $0.01/M,是 Haiku 4.5($0.10)的十分之一。在 agentic 长会话里,绝大多数的输入 token 是按缓存价计费的——Prompt Caching 一文里写过,较长的 agentic 对话中超过 90% 的输入 token 走缓存价。所以「输入价降 90%」这个 headlines 数字其实低估了真实降幅,真正的账单变化要看缓存读。

反过来说,>100K 档的定价是给「长上下文」收的溢价:一旦单次请求的输入越过 100K,输入价就翻 5 倍到 $0.50。这决定了 Haiku 5.5 的正确用法不是「把 1M 全塞满」,而是小提示高频调用 + 缓存命中。

它适合什么,不适合什么

官方对 Haiku 5.5 的定位说得很直白:Sonnet 5.5 与 Opus 5.5 仍是复杂 agentic 编程任务(如 Terminal-Bench 4.0 这类)更好的选择;Haiku 5.5 适合的是那些「以前因为成本而做不了」的窄范围任务——官方点名的例子是压缩(compaction)、摘要、子 agent 工作。

这就把 Haiku 5.5 的位置说清楚了:它不是一个「便宜版的 Sonnet」,而是给流水线里那些要跑成千上万遍、单次不需要深度推理的环节准备的。典型场景包括:

  1. 上下文压缩与会话摘要——长会话 agent 的 上下文压缩 环节,这恰好是官方点名的用途,且 1M 上下文意味着压缩前能装入更多历史;
  2. 子 agent 批量调用——多 agent 编排里子 agent 数量远多于主 agent,把子 agent 换成 Haiku 5.5 的账单降幅远超直觉;
  3. 分类、抽取、路由——高并发且任务明确的传统 Haiku 强项,现在单价只有原来的十分之一;
  4. computer use / browser use——官方同日在 SDK 里开放了这两项 beta,并明确说 Haiku 5.5「凭速度、能力与价格的组合特别适合这类任务」。

不适合的:需要复杂多步推理的核心决策环节(那是 Opus 5.5 / Sonnet 5.5 的活),以及把 1M 上下文当默认装法的高频长提示调用(会直接落进 >100K 的高价档)。

关于基准数字:本站能确认与不能确认的

官方发布页给出了一组基准对比(本站经发布页内容与多家转引核对,未逐项打开官方原始表格核验,故按转引标注):Haiku 5.5 在 Terminal-Bench 4.0 上为 39.2%(Haiku 4.5 为 0.0%)、FrontierCode v1.1(Main) 为 46.4%(Haiku 4.5 为 6.4%)、OSWorld 2.1 离线子集 为 72.4%(Haiku 4.5 为 15.7%)、Humanity's Last Exam 无工具 45.9% / 有工具 57.4%、GDPval-AA v2.1 为 1620(Haiku 4.5 735、GPT-6 Luna 1437、Sonnet 5.5 1840)。

这里有一条比数字本身更重要的信息:Terminal-Bench 4.0 的 39.2% 在官方自己的图里仍明显低于 Sonnet 5.5(官方图表把 Sonnet 5.5 画在更高的精度区间)。也就是说厂商自己都不主张 Haiku 5.5 能替代 Sonnet 做 agentic 编程——这与上文的产品定位是一致的。

另外,官方系统卡写明 Haiku 5.5 的知识截止为 2026-06、输出为纯文本(输入支持文本与图像)。

AI 之家 观点

这次发布的真主角不是 Haiku 5.5,是同日那条「Sonnet 5.5 缓存读降半」。 Haiku 档降价是预期内的节奏,但 Anthropic 在发布页里专门用一段讲 Sonnet 5.5 的缓存读从 $0.20 降到 $0.10、并配了 Terminal-Bench 4.0 的「精度 vs 成本」图——这说明厂商已经把竞争焦点从标价挪到了缓存价。对正在跑 agentic 长会话的团队,这条的实际影响大于 Haiku 5.5 本身:缓存读在长对话里占绝对大头,砍半就是实打实的账单变化。建议立刻做的一件事:把你过去一个月的 API 账单按「输入 / 缓存读 / 输出」拆开,如果缓存读占比超过 70%,Sonnet 5.5 这次降价对你的影响比换模型大得多。

第二个值得注意的点是「分档定价」这个新结构。 以前选模型只需要看一个单价,现在 Haiku 5.5 要求你先回答「我的请求会不会越过 100K」。这实际上是把「上下文长度」变成了定价维度——它惩罚的是「无脑塞满上下文」的用法。本站的建议是:在接 Haiku 5.5 之前先埋一个输入 token 长度的监控,搞清楚你的 p50 / p95 落在哪一档,再决定要不要为长提示买单。仅凭「1M 上下文很便宜」这句话就上,很容易在 p95 请求上撞到 5 倍价。

第三个点是 effort 参数下放到 Haiku 档。 这是第一次可以在轻量档上「同一模型、两种成本」——对分层架构是个新工具:主 agent 用 Sonnet/Opus 开高 effort 做决策,子 agent 用 Haiku 5.5 开低 effort 做批量,比过去按模型分层的粒度更细。但这个参数刚下放,各家 harness 的支持程度不一,接入前请确认你用的工具链真的把它透传了,而不是默默忽略。

待核实

  • Max / Team 订阅的月度 API 信用额度:官方发布页称「本周内」向 Max 与 Team 订阅者发放月度 API credit(Max 5x $100/月、Max 20x $200/月、Team 最高 $500 且可池化)。该措辞为「本周将推出」,本站核对时未见已完成的上线公告,故不作为既成事实记录。
  • Haiku 4.5 的退役时间:本站此前记录的「退役不早于 2026-10-15」来自第三方整理,未见官方确认,且该日期已过。请以 Anthropic 官方模型总览页的弃用公告为准。
  • 基准原表:上文基准数字为转引,未逐项核对官方原始表格。

来源

本资讯由 AI 之家 编辑部根据 Anthropic 官方发布页与官方 CHANGELOG 整理,非厂商付费内容。规格与定价以 Anthropic 官方页面为准;基准数字为转引,已标注未逐项核对。欢迎在 反馈邮箱 反馈更新。

相关对比

Aider vs Claude Code:终端 AI 编程双雄怎么选

Aider vs Claude Code 2026 选型对比:开源 BYOK 多模型 vs Anthropic 订阅长任务 Agent,从编程能力、多模型支持、价格、Git 集成、国内可用性和适合人群判断,帮你选对终端 AI 编程工具。

Cursor vs Aider:GUI IDE 还是 CLI?2026 对比

Cursor vs Aider 2026 选型对比:GUI IDE vs Git 原生 CLI,从 Composer vs Architect 双模型、Tab 补全、多模型 BYOK、价格计费、开源与否和适合人群判断,帮开发者选对。Cursor 是闭源 VS Code fork 月费 $20,Aider 是开源 Apache-2.0 CLI 自带 API key。

Augment Code vs Cursor:企业 AI 编程怎么选?Context Engine vs AI IDE 对比

Augment Code vs Cursor 2026 选型对比:Context Engine 全仓索引的企业 AI 平台 vs SpaceX 收购的 AI IDE 天花板,从形态、Context 覆盖、长任务、价格、合规、中文支持和适合人群 8 个维度判断,帮你选对企业 AI 编程工具。

Claude Code vs Cline:CLI AI Agent 怎么选?2026 对比

Claude Code vs Cline 2026 选型对比:Anthropic 官方闭源 CLI Agent vs Apache-2.0 开源 VS Code 插件。从模型绑定、工作流、MCP 支持、价格、隐私和适合人群 6 个维度帮你选对 CLI AI 编程工具。

Claude Code vs Codex CLI:终端 AI Agent 双雄对比

Claude Code vs Codex CLI 2026 选型对比:Anthropic 与 OpenAI 两大官方终端 Agent 的模型、长任务、MCP 生态、Windows 支持、订阅打包价格和国内可用性全方位对比,帮你判断该用哪个终端 AI Agent,以及能不能两个一起用。

Claude Code vs Crush:Anthropic 官方 vs 多模型 TUI(2026 实测选型)

Claude Code vs Crush 2026 选型对比:Anthropic 官方 CLI Agent(Claude only + 长任务最稳 + MCP 一等公民)vs Charmbracelet 开源 TUI Agent(多模型 mid-session 切换 + LSP + FSL-1.1-MIT)。从模型、长任务、生态、价格、国内可用性帮你选对终端 AI 编程工具。

相关评测