跳到主内容

OpenAI 发布 GPT-5.6 家族:Sol / Terra / Luna 三档分层,Agent 能力再进一步

2026-07-09 · OpenAI

要点

  • 三档分层:Sol(旗舰)/ Terra(均衡)/ Luna(低成本),另有 Sol Ultra 高配
  • 1.1M 上下文,原生 reasoning + vision
  • 定价(每 1M input/output):Sol $5/$30、Terra $2.50/$15、Luna $1/$6
  • 基准(Terminal-Bench 2.1):Sol Ultra 91.9% · Sol 88.8% · Terra 84.3% · Luna 82.5%
  • 新特性:Programmatic Tool Calling、multi-agent beta、ultra 模式默认 4 并行 agent(最多可配 16)
  • 全平台上线:OpenAI API / ChatGPT / Codex / GitHub Copilot / Devin / Microsoft 365 Copilot

从"一个旗舰"到"一条产品线"

GPT-5.6 最大的变化不在单点能力,而在产品策略:OpenAI 不再押注单一旗舰,而是同一天推出三个定位不同的型号。

型号定位Input/Output(每 1M)Terminal-Bench 2.1
Sol Ultra极限能力,subagent 编排-91.9%
Sol前沿编码/Agent 默认$5 / $3088.8%
Terra均衡,对标 GPT-5.5 价位$2.50 / $1584.3%
Luna预算前沿$1 / $682.5%

这套分层直接呼应了 2026 年整个行业的主题——模型选型从"谁最强"转向"谁在高频工作流里跑得久、花得省"。Terra 用 GPT-5.5 的价格换来更高的编码分,Luna 则把前沿能力压到 $1/$6 的入门价。

背景上下文

GPT-5.6 的三档分层并非 OpenAI 的首创——Claude 已有 Opus/Sonnet/Haiku 分层,Gemini 也有 Ultra/Pro/Flash 分层。但 OpenAI 是第一个在同一次发布中同时推出三档并明确各自定位的厂商,而非像过去那样先发旗舰、数月后再补中低端。

这个策略转变的背后是市场压力。2026 年上半年,DeepSeek V4 把价格压到 $0.14/$0.28,Claude Sonnet 5 以 $2/$10 促销价抢占中端,Grok 4.5 以 $2/$6 卡位"Opus 级半价"。如果 OpenAI 继续只推单一旗舰 Sol,就会在"便宜够用"这个增长最快的细分市场完全缺位。三档同时发布,是对竞争格局的直接回应。

另一个背景是 Codex CLI 的崛起。Codex 作为 OpenAI 的终端 Agent,需要一个"便宜但够用"的模型来跑高频任务——Luna 正是为此设计。同时,Copilot 转向按量计费后,模型费率成为用户敏感因素,Terra 的定位恰好填补"比 Sol 便宜、比 Luna 强"的中间位。

技术细节

  • 1.1M 上下文:三档均支持 110 万 token 上下文,采用改进的稀疏注意力与分块 KV cache,长上下文场景的推理延迟较 GPT-5.5 下降约 25%。
  • 原生 reasoning + vision:三档均原生支持推理模式与视觉理解,无需外挂模块。reasoning 模式可根据任务复杂度自动启停(类似 Claude 的 adaptive thinking)。
  • Programmatic Tool Calling:这是 GPT-5.6 最重要的新特性之一。传统 tool calling 是"一轮一个工具调用"的串行模式,而 Programmatic Tool Calling 允许模型在单次响应中以程序化方式批量编排多个工具调用——包括并行调用、条件分支、错误重试等。这大幅减少了多轮往返,长任务更省 token 也更快。
  • multi-agent / ultra 模式:Sol Ultra 默认拉起 4 个并行 agent,最多可配 16 个。每个子 agent 可以独立规划、执行、验证,主 agent 负责编排与合并结果。这与 Claude Code 的 /subtask、Cursor 的 /multitask、Devin Local 的子 Agent 是同一方向,但 OpenAI 的实现更强调"自动拆解"而非"用户手动指定"。
  • 三档共享底座:Sol、Terra、Luna 共享同一个基础模型底座,差异主要在参数激活规模、推理深度和训练数据配比上。这意味着三档在"风格"上高度一致,切换模型不会产生风格突变,这对模型路由场景很重要。

Agent 侧的两个关键升级

  • Programmatic Tool Calling:模型可以用程序化方式批量编排工具调用,减少多轮往返,长任务更省 token。实测显示,在需要 5+ 次工具调用的 Agent 任务中,Programmatic Tool Calling 可减少约 30-40% 的总 token 消耗。
  • multi-agent / ultra 模式:默认拉起 4 个并行 agent,最多可配 16 个,用于把大任务拆给多个子 agent 同时干。这与 Claude Code 的 /subtask、Cursor 的 /multitask 是同一方向。OpenAI 的差异化在于子 agent 的"自动拆解"能力——用户只需描述目标,模型自行决定如何拆分。

一段"政策时钟"插曲

GPT-5.6 在正式全球开放前,曾按美国政府要求被限制在约 20 家审核伙伴内约 14 天,直到 7-09 才对所有 ChatGPT / Codex / API 用户放开。这也是 2026 年少见的"模型发布受政策节奏影响"的案例——但从结果看,前沿模型的发布仍由竞争节奏而非政策节奏主导。

这段插曲也说明,随着模型能力增强(尤其是 multi-agent 编排能力),监管机构对"模型发布前审核"的重视程度在上升。14 天的审核期虽短,但可能成为未来重磅模型发布的常态前置环节。

行业影响

GPT-5.6 三档分层对行业格局的影响是全方位的:

  1. 直接对标竞品:Sol 对标 Claude Opus 4.8 / Gemini 3.1 Ultra,Terra 对标 Claude Sonnet 5 / Grok 4.5,Luna 对标 DeepSeek V4 Flash。OpenAI 用一次发布覆盖了所有价位段。
  2. 模型路由成为刚需:当三档模型风格一致但价差 5 倍,"简单任务用 Luna、中等任务用 Terra、硬任务用 Sol"的路由策略价值凸显。Copilot 的 AI Credits 计费进一步放大了这个需求——选对模型直接省 credits。
  3. multi-agent 标准化:OpenAI 把 multi-agent 作为原生能力(而非插件)推出,可能推动"多 Agent 协作"从实验性功能变成生产标配。
  4. 对 Codex CLI 的拉动:Codex 作为终端 Agent,有了 Luna($1/$6)这个低成本选项后,高频任务的可行性大增。这直接增强了 Codex 对 Claude Code 的竞争力。

AI 之家 观点

对开发者最实际的影响是模型路由:把补全类、样板类任务丢给 Luna 或 Terra,把真正需要推理的架构决策留给 Sol。在 Copilot 转向 AI Credits 按量计费后,这种"按任务选型"的省钱策略价值更明显。

如果你在 Codex / Copilot 里做重度 Agent 工作,值得先用 Sol、Terra、Luna 各跑一遍你自己的基准,再决定默认模型——发布周的榜单分数不等于你项目里的实际表现。一个实用建议:先用 Terra 跑两周,记录哪些任务"搞砸了"需要重跑,把这些任务切到 Sol,其余保持 Terra——这通常是成本与质量的最优平衡点。

相关阅读