跳到主内容
codingOpenAI

GPT-6 Sol

OpenAI 于 2026-09-22 发布的 GPT-6 中阶主力 gpt-6-sol:API 价 $2 输入 / $10 输出每百万 token,较 GPT-5.6 Sol 促销价腰斩,1.05M 上下文 / 128K 输出,官方定位复杂编程与 agentic 工作流,已在 Codex、ChatGPT Work 与 API 上线。

发布 2026-09-24更新 2026-09-24核实 2026-09-24

规格

厂商
OpenAI
发布日期
2026/9/22
类型
coding
上下文窗口
1050K tokens
最大输出
128K tokens
定价
$2 输入 / $10 输出 每百万 token(缓存读最高 90% 折扣)
API 兼容
openai, azure-openai, bedrock

基准测试

33.2%(xhigh,单任务约 $0.27)
AutomationBench(OpenAI 自报)
1,050,000 / 128,000 token
上下文 / 最大输出
2026-04-20
知识截止
错误量约为上一代一半(OpenAI 口径)
内部事实准确性评估

优势

  • •API 价格较 GPT-5.6 Sol 促销价腰斩:$2/$10 每百万 token
  • •1.05M 上下文 + 128K 最大输出,与上代同规格
  • •OpenAI 内部事实准确性评估:错误量约为上一代的一半
  • •reasoning effort 六档可调(none~max),成本与效果可按任务分档
  • •改 reasoning effort 或工具集不再让 prompt 缓存失效,agent 会话成本更稳

不足

  • •官方明确定位低于 GPT-6 Astra,不是最强档
  • •仅文本输出:图片可输入但不支持音视频
  • •Chat Completions 仅在 reasoning_effort=none 时支持 function calling,用内置工具需走 Responses API
  • •AutomationBench 自报 33.2%(xhigh),仍低于 Astra 的 41.4%(Anthropic 表口径)
  • •国内无官方 API,需走 Azure 或中转

适用场景

复杂编程与 agentic 工作流(官方点名的主战场)代码审查、调试、数据分析等重复性专业任务Codex / ChatGPT Work 的日常主力模型高性价比长上下文:大仓库分析、多文档综合

概述

GPT-6 Sol(API 模型 ID gpt-6-sol)是 OpenAI 于 2026 年 9 月 22 日(美西时间;国内报道多在 9 月 23 日)发布的 GPT-6 家族中阶模型,与同日发布的轻量款 GPT-6 Luna 一起补齐了产品矩阵。至此 GPT-6 形成旗舰 Astra → 中阶 Sol → 轻量 Luna 的三档结构。

一句话概括它的意义:把 Astra 那代的能力,压到一个能日常跑的价格。 官方原话是「Sol 和 Luna 建立在 Astra 背后的进展之上,把它的大部分优势带进更快、更负担得起的模型,以支撑规模化工作」,并把降价直接归因于缓存与推理效率的提升。

2026-09-24 更新(本站前情修订):此前 GPT-6 Astra 模型卡 中「GPT-6 Sol 尚未获官方确认」的判断已作废——OpenAI 已于 2026-09-22 在官方开发者社区正式公告 Sol 与 Luna 上线,本卡为取代该待核实条的正式条目。

三档定价对照(官方定价页 / 公告):

模型输入 / 输出(每百万 token)定位
GPT-6 Astra$10 / $50旗舰,能力最强
GPT-6 Sol$2 / $10中阶,复杂编程与 agent 工作流
GPT-6 Luna$0.10 / $0.50轻量,高频批量任务

核心能力

定位:Sol 写代码,Luna 跑批量

官方模型页给了非常直接的分工:

  • Sol —— 面向复杂编程与 agentic 工作流:实现功能、代码审查、调试、数据分析这类需要多步推理的活;
  • Luna —— 「我们最高效的模型」,面向定义清晰、量大的常规任务:文档摘要、信息抽取、快速问答。

两者规格一致:1,050,000 token 上下文窗口、128,000 最大输出;知识截止 Sol 为 2026-04-20、Luna 为 2026-05-18。输入支持图片,输出仅文本,不支持音频与视频。

reasoning effort 六档

none / low / medium(默认)/ high / xhigh / max。默认 medium 是个重要信号:OpenAI 认为多数任务不需要拉满推理档就能拿到可用结果,成本因此可以下探。

一个容易踩的接口约束:要用内置工具与 function calling,官方推荐走 Responses API;Chat Completions 仅在 reasoning_effort=none 时支持 function calling。老代码直接换 model id 可能静默失效。

可靠性:官方口径的「错误减半」

OpenAI 称在内部事实准确性评估(基于用户实际报错的真实对话)中,GPT-6 Sol 的错误量约为上一代的一半,并强调两款模型在安全对齐评估上也有改善,包括减少对自己编程工作作出误导性陈述。

同时官方给了一句必要的降温:这些评估刻意设置了具有挑战性的情境,结果不能直接视为日常使用中的错误率。把它当「相对改善」而非「绝对错误率」来读。

成本:AutomationBench 的性价比账

腾讯新闻援引 OpenAI 公布的结果(AutomationBench,覆盖 47 种工具的销售/营销/运营/客服/财务/HR 工作流):

模型档位得分单任务成本(相对 Sol)
GPT-6 Solxhigh33.2%约 $0.27(基准 1x)
GPT-6 Astralow30.3%约 3.9x
Claude Fable 5.1—31.4%超过 8.9x
Claude Opus 5max26.9%约 11.1x

口径提示:该组数字为 OpenAI 自报,与 Anthropic 官方发布表中 AutomationBench 的口径不同(Anthropic 表列 Claude Opus 5.5 40.0%、GPT-6 Astra 41.4%,由 Zapier 运行且把 safeguard 干预计为失败)。跨厂商对比时必须写明「谁跑的、什么档位、什么规则」,裸比分没有意义。

API 调用示例

from openai import OpenAI

client = OpenAI(api_key="sk-...")

# 推荐 Responses API:内置工具与 function calling 的完整支持
resp = client.responses.create(
    model="gpt-6-sol",
    reasoning={"effort": "medium"},   # none/low/medium(默认)/high/xhigh/max
    input="审查这段鉴权代码,列出问题并给出补丁",
)
print(resp.output_text)
# Chat Completions 下若要 function calling,必须显式把 effort 设为 none
resp = client.chat.completions.create(
    model="gpt-6-sol",
    reasoning_effort="none",
    messages=[{"role": "user", "content": "提取这段文本里的所有订单号"}],
    tools=[...],
)

定价(2026-09-24 核对)

项目GPT-6 SolGPT-5.6 Sol(促销价)变化
输入(每百万 token)$2$4−50%
输出(每百万 token)$10$20−50%
缓存输入最高 90% 折扣—同日优化

OpenAI 把这轮降价称为永久性下调(区别于限时促销)。配套的缓存改动对 agent 场景影响更大:调整 reasoning effort 或工具可用性不再使缓存失效,并新增了 Prompt Caching Dashboard 与 miss Diagnostics 用于定位缓存未命中的原因——长会话 agent 的成本大头本就在缓存读,这条比标价下调更值钱。

待核实:有汇总报道称 OpenAI 产品线中最便宜的 Terra 档已下线。该说法未见 OpenAI 官方公告确认,本站不据此给出迁移建议,请以官方定价页为准。

适合 / 不适合

适合

  • 需要 Astra 级别可靠性但预算只到中阶档的编程 / agent 流水线;
  • Codex CLI、ChatGPT Work 的日常主力;
  • 长上下文批处理:大仓库分析、多文档综合(1.05M 窗口);
  • 想通过 effort 档位做成本分层的团队(简单任务 low、难关 xhigh)。

不适合

  • 追求绝对能力上限——那仍是 GPT-6 Astra;
  • 需要图像 / 音频 / 视频输出(仅文本输出);
  • 已经在 Chat Completions 上重度依赖 function calling 且不愿改 Responses API 的存量代码;
  • 高频跑量——GPT-6 Luna 便宜 20 倍。

避坑清单

  1. 别只换 model id 就上线:Chat Completions 下的 function calling 受 reasoning_effort=none 限制,工具调用场景改走 Responses API。
  2. 默认 effort 是 medium:追求质量要显式上调,追求成本要显式下调——不写就是 medium。
  3. 缓存失效规则变了但别盲信:新规则是「改 effort / 工具不失效」,实际命中率用 miss Diagnostics 自己验一遍再下成本结论。
  4. 知识截止 2026-04-20:涉及 4 月之后事件的问答必须配检索工具。
  5. 国内无官方 API:走 Azure OpenAI 或 OpenRouter 等中转,注意数据出境合规。
  6. 跨厂商基准别裸比:AutomationBench 有三套口径(OpenAI 自报 / Anthropic 转引 Zapier / 第三方复现),引用时写明来源。

相关阅读

来源

本卡片由 AI 之家 编辑部根据公开资料整理,非厂商付费内容。定价以 OpenAI 官方定价页为准,基准数据已标注自报 / 第三方口径;欢迎在 反馈邮箱 反馈更新。

相关对比

Aider vs Claude Code:终端 AI 编程双雄怎么选

Aider vs Claude Code 2026 选型对比:开源 BYOK 多模型 vs Anthropic 订阅长任务 Agent,从编程能力、多模型支持、价格、Git 集成、国内可用性和适合人群判断,帮你选对终端 AI 编程工具。

Claude Code vs Cline:CLI AI Agent 怎么选?2026 对比

Claude Code vs Cline 2026 选型对比:Anthropic 官方闭源 CLI Agent vs Apache-2.0 开源 VS Code 插件。从模型绑定、工作流、MCP 支持、价格、隐私和适合人群 6 个维度帮你选对 CLI AI 编程工具。

Claude Code vs Codex CLI:终端 AI Agent 双雄对比

Claude Code vs Codex CLI 2026 选型对比:Anthropic 与 OpenAI 两大官方终端 Agent 的模型、长任务、MCP 生态、Windows 支持、订阅打包价格和国内可用性全方位对比,帮你判断该用哪个终端 AI Agent,以及能不能两个一起用。

Claude Code vs Crush:Anthropic 官方 vs 多模型 TUI(2026 实测选型)

Claude Code vs Crush 2026 选型对比:Anthropic 官方 CLI Agent(Claude only + 长任务最稳 + MCP 一等公民)vs Charmbracelet 开源 TUI Agent(多模型 mid-session 切换 + LSP + FSL-1.1-MIT)。从模型、长任务、生态、价格、国内可用性帮你选对终端 AI 编程工具。

Claude Code vs Gemini CLI:终端 AI Agent 怎么选?(2026 选型指南)

Claude Code 和 Gemini CLI 都是终端原生的 AI 编码 Agent。一句话结论 + 决策树 + 价格 + 国内可用性对比:长任务与 CLAUDE.md 生态选前者,免费额度与接入门槛选后者。

Codex CLI vs Crush:OpenAI 官方 vs 多模型 TUI(2026 实测选型)

Codex CLI vs Crush 2026 选型对比:OpenAI 官方终端 Coding Agent(GPT-5.6 + Windows 原生沙箱 + Apache-2.0)vs Charmbracelet 开源 TUI Agent(多模型 mid-session 切换 + LSP + FSL-1.1-MIT)。从模型、平台、生态、价格、国内可用性帮你选对终端 AI 编程工具。