跳到主内容
codingOpenAI

GPT-6 Astra

OpenAI 2026 年 9 月 3 日发布的新旗舰 GPT-6 Astra,GPT-5.6 Sol 的继任者,1.05M 上下文,主打 computer use 与长程 Agent 任务,OSWorld 2.0 达 72.6%,定价 $10/$50 每百万 token。

发布 2026-09-06更新 2026-09-06核实 2026-09-06

规格

厂商
OpenAI
发布日期
2026/9/3
类型
coding
上下文窗口
1050K tokens
最大输出
128K tokens
定价
$10 输入 / $50 输出 / 百万 token(缓存读 $1、缓存写 $12.50)
API 兼容
openai, azure-openai, bedrock

基准测试

72.6%(GPT-5.6 Sol 为 65.7%)
OSWorld 2.0
97.6%(Sol 为 83.0%)
FrontierMath Tier 4 v2
57.9%(Sol 为 37.3%)
Terminal-Bench 4.0
100%(Sol 为 78.5%)
ExploitBench
99.9%(无状态 API 为 17-63%)
ARC-AGI-3(adapter harness)
96.3%(Sol 为 73.8%)
MRCR v2 8-needle(512K-1M)
74.1%
DeepSWE v1.1

优势

  • computer use 头牌:OSWorld 2.0 达 72.6%,且单任务耗时比 GPT-5.6 Sol 缩短约 47%
  • 1.05M 超长上下文,512K-1M 区间检索可靠性 96.3%(MRCR v2)
  • 网络安全能力首个触及自家 Preparedness Framework「Critical」阈值的 OpenAI 模型
  • Codex 获持久化可搜索笔记,替代旧版 compaction 摘要,长会话不丢上下文
  • 产出「成品级」专业文档:按模板出 PPT/表格/文档,另配 Sites 直接建站

不足

  • 定价 $10/$50 为 GPT-5.6 Terra 的 4 倍,跑量场景成本压力大
  • ARC-AGI-3 99.9% 依赖有状态 harness,无状态 API 调用实测仅 17-63%
  • HLE(带工具)57.2%,落后 Claude Fable 5.1 的 65.0%,并非全面碾压
  • 安全能力被刻意门控,正常安全工作也可能被拒答
  • 国内无官方 API,需走中转或 Azure

适用场景

浏览器/桌面自动化:填表单、改 CRM、前端 QA、看屏排障数小时级长程编程与 multi-agent 工作流(Codex)法律合同审查、大代码库分析等文档密集型流水线防御性安全任务:安全代码评审与补丁

概述

GPT-6 Astra(模型 ID gpt-6-astra)是 OpenAI 于 2026 年 9 月 3 日发布的新一代旗舰,GPT-5.6 Sol 的继任者。它没有把叙事押在「聊天更聪明」上,而是明确定位 agentic execution:操作电脑、完成多步专业工作、在长会话里持续编程。官方称其在得州 Stargate 基地用超过 10 万块 GPU 训练完成,总裁 Greg Brockman 在发布会上表示「欢迎进入 AGI 时代」。

参数面:1.05M token 上下文 / 128K 最大输出,输入支持文本 + 图片(输出仅文本),知识截止 2026 年 4 月 30 日,推理档位五档(low ~ max),不支持微调。工具生态覆盖 Web 搜索、文件搜索、代码解释器、hosted shell、computer use、MCP 与 skills。

值得注意的时间线:Astra 的发布因 2026 年 7 月一起涉及 Hugging Face 托管评测环境的安全事件而推迟,这直接催生了系统卡里新增的「模型是否越权」评估项——能力越强、门控越严,是这代旗舰的共同特征(同周发布的 Gemini 3.8 Flash CyberClaude Fable 5.1 也走了分级开放路线)。

核心能力

computer use:更快且更准,而非二选一

OSWorld 2.0(真实桌面任务:开应用、点击、输入、多步工作流)拿到 72.6%(Sol 为 65.7%),同时单任务耗时缩短约 47%(约 40 分钟 vs 75 分钟)——对 Agent 场景这是比准确率更关键的数字,因为 Agent 成本随时长膨胀。典型任务:填表单、更新 CRM、跑前端 QA、看屏幕排障。

但有一个必须知道的 caveat:ARC-AGI 官方组织指出,Astra 最亮眼的 computer use 与推理数字依赖评测 harness——标准无状态 API 调用的得分明显低于 OpenAI 的有状态「provider adapter」harness(ARC-AGI-3 无状态实测约 17-63%)。简单 API 集成别指望复现发布日头条数字。

编程与长会话:Codex 拿到持久化笔记

  • Terminal-Bench 4.0:57.9%(Sol 37.3%,Claude Fable 5.1 为 55.8%);
  • DeepSWE v1.1:74.1%;FrontierCode 1.1 约 53%,与 Claude 旗舰基本打平——编程优势并非每个基准都领先;
  • Codex 持久化笔记(实验性、opt-in):旧模型的「compaction」摘要会在上下文塞满时悄悄丢失推理过程,Astra 改为跨上下文窗口维护可搜索笔记,旧窗口仍可检索。OpenAI 计划数周内转为默认开启;
  • 中途转向更稳:新指令插入时不再把转向消息当成全新目标;真正影响结果的缺口才提问,Codex 里还能异步提问并继续干不依赖答案的部分。

长上下文:1.05M 窗口 + 高检索可靠性

512K-1M 区间的 MRCR v2 8-needle 检索拿到 96.3%(Sol 为 73.8%),「迷失在中间」问题明显缓解。适合法律合同审查、大代码库分析、多文档研究综合。

网络安全:首个「Critical」级,刻意门控

这是本次发布最实质的变化:Astra 是首个触及 OpenAI Preparedness Framework 网络安全「Critical」阈值的模型——ExploitBench(已知漏洞转可用利用)100%(Sol 78.5%),SRE-Bench(无源码逆向编译产物)单次尝试解决 88%;内部测试中还在近三个月披露的漏洞集里发现两个此前未知的零日漏洞(已按流程披露)。因此公开版本刻意做了能力裁剪:协助防御性任务(安全代码评审、打补丁),拒绝构造 PoC 利用;更宽松的访问走面向受审防御场景的 Daybreak 项目。副作用是正常安全工作也可能被暂停或拒绝,OpenAI 官方承认这一权衡。

成品级文档产出

训练目标是「按模板出成品」而非「吐 Markdown 初稿」:幻灯片、表格、文档会贴合既有视觉样式,只拉取任务相关的上下文。配套 ChatGPT 的 Sites 功能,可从一条 prompt 直接生成并托管简单网站、Web 应用与游戏。

API 调用示例

from openai import OpenAI

client = OpenAI(api_key="sk-...", base_url="https://api.openai.com/v1")

resp = client.responses.create(
    model="gpt-6-astra",
    input="分析这个仓库的鉴权模块,列出安全风险并给出补丁建议",
)
print(resp.output_text)

定价(2026-09 核对)

项目价格(每百万 token)
输入$10
缓存读$1
缓存写$12.50
输出$50
Fast 模式2.5x 速度,2x 价格(约 $20/$100)
Batch / Flex标准价 5 折

注意:单次请求超过 272K 输入 token 后,整个请求按输入/缓存价 2 倍、输出价 1.5 倍计费。作为参照:GPT-5.6 Terra 为 $2.50/$15,Claude Opus 5 档为 $5/$25——Astra 是纯粹的旗舰定价,不适合高频跑量。

在国内怎么用

官方 API 不直供国内,路径与 GPT-5.6 相同:Azure OpenAI(Microsoft Foundry 限量访问项目)或 OpenRouter 等中转。ChatGPT Plus / Pro / Business / Enterprise 订阅内可用(Pro 及以上另有 Astra Pro 档);Workspace 企业版默认关闭,需管理员显式开启。

与同档模型怎么选

维度GPT-6 AstraClaude Fable 5.1Gemini 3.8 FlashGPT-5.6 Terra
输入/输出价(/1M)$10/$50$10/$50$0.75/$3.75(促销)$2.50/$15
上下文1.05M1M1M1.1M
computer use72.6%59.0%
长程编程57.9%55.8%19.1%
综合推理GPQA 96.0% / HLE 57.2%HLE 65.0%HLE 54.9%
国内可用需中转需中转需合规通道需中转

决策参考:桌面/浏览器自动化与防御性安全任务,Astra 是当前首选;极致长程推理与知识工作(HLE 65.0%)Claude Fable 5.1 更稳;高并发 Agent 流水线用 Gemini 3.8 Flash 控成本;日常编程 GPT-5.6 Terra / Claude Sonnet 5 的性价比仍更高。

避坑清单

  • 别拿无状态 API 复现头条分数:ARC-AGI-3 99.9% 与部分 computer use 数字依赖有状态 harness,自建集成请按 17-63% 的区间做预期。
  • 长请求计费陷阱:超过 272K 输入 token 后整单 2 倍/1.5 倍计费,长文档任务先切分或用缓存。
  • 安全工作会被误拦:公开版刻意拒绝高阶安全请求,合法渗透测试/漏洞分析任务可能被暂停,评估 Daybreak 项目或换用 Gemini 3.8 Flash Cyber(Fairwind 计划)。
  • Enterprise 默认关闭:企业 Workspace 需管理员手动开启才能用上。
  • 不支持微调:需要定制行为的场景走 prompt / tools / skills 组合。

FAQ

Q: GPT-6 Astra 会替代 GPT-5.6 吗? A: Astra 是 Sol 的继任者,但 GPT-5.6 Terra / Luna 继续承担中低成本档位,OpenAI 并未宣布下线。多数日常编程任务留在 Terra 性价比更高。

Q: Astra 和 Claude Fable 5.1 怎么选? A: 同为 $10/$50 旗舰档。computer use、终端自动化、防御性安全选 Astra;多步研究、知识工作、长程 agentic coding 的基准(HLE 65.0%、Terminal-Bench 55.8%)Fable 5.1 有一战之力,建议按自家 eval 结果定。

Q: ARC-AGI-3 的 99.9% 可信吗? A: 分数本身来自 OpenAI 的 adapter harness 且复现成本数万美元;ARC-AGI 官方已说明无状态调用会显著掉分。把它当「能力上限信号」而非「日常 API 表现」。

延伸阅读

来源

本卡片由 AI 之家 编辑部根据公开资料整理,非厂商付费内容;定价与基准以 OpenAI 官方页面为准,欢迎在 反馈邮箱 反馈更新。

相关工具

相关对比

Claude Code vs Codex CLI:终端 AI Agent 双雄对比

Claude Code vs Codex CLI 2026 选型对比:Anthropic 与 OpenAI 两大官方终端 Agent 的模型、长任务、MCP 生态、Windows 支持、订阅打包价格和国内可用性全方位对比,帮你判断该用哪个终端 AI Agent,以及能不能两个一起用。

Codex CLI vs Crush:OpenAI 官方 vs 多模型 TUI(2026 实测选型)

Codex CLI vs Crush 2026 选型对比:OpenAI 官方终端 Coding Agent(GPT-5.6 + Windows 原生沙箱 + Apache-2.0)vs Charmbracelet 开源 TUI Agent(多模型 mid-session 切换 + LSP + FSL-1.1-MIT)。从模型、平台、生态、价格、国内可用性帮你选对终端 AI 编程工具。

Codex CLI vs Gemini CLI:两家大厂终端 Agent 怎么选?(2026 选型)

OpenAI Codex CLI 与 Google Gemini CLI 的正面比较:一句话结论 + 决策树 + 价格 + 国内可用性。已有 ChatGPT 账号选 Codex,想零成本起步选 Gemini CLI。

OpenRouter vs LiteLLM:LLM API 网关怎么选?SaaS 聚合 vs 开源自托管

OpenRouter vs LiteLLM 2026 选型对比:从模型数量、自托管能力、fallback 策略、虚拟 Key、国内延迟、成本结构和适合人群判断,帮你决定用 SaaS 聚合 OpenRouter 还是用开源自托管 LiteLLM 做 LLM 网关。

OpenRouter vs One API:托管模型路由与自建网关怎么选(2026)

OpenRouter 是托管的模型路由服务,One API 是自建的 API 分发网关。一句话结论 + 决策树 + 成本对比:要零运维接入几百个模型选前者,要数据自控与团队分发选后者。