跳到主内容

OpenAI 发布 GPT-6 Astra(2026-09-03):1.05M 上下文 Computer Use 旗舰,逐步灰度

2026-09-12 · OpenAI 官方发布说明(2026-09-03)+ 平台 changelog 与第三方报道整合

要点

  • 发布时间与形态:GPT-6 Astra 于 2026-09-03 以 GA 形式发布,但 尚未全面开放,正分批向有限组织灰度(Plus / Pro / Business / Enterprise 逐步铺开);同步上线 API、Microsoft Azure 与 AWS Bedrock。
  • 定位:OpenAI 目前在 编码、研究、computer use、复杂多步工作 上的最强模型,能把文档 / 表格 / 演示文稿 / 网站 / 应用从初始请求推进到成品,并在你追加要求或改变方向时自适应调整。
  • 关键能力:computer use 头牌(OSWorld 2.0 72.6%,单任务耗时比 GPT-5.6 Sol 短约 47%);1.05M 上下文,512K–1M 区间检索可靠性 96.3%(MRCR v2)。
  • 安全门控:官方称其为首个广泛部署即触及自家 Preparedness Framework「Critical」网络安全能力阈值的 OpenAI 模型;agent 工作期间异步做 misalignment 监测,必要时暂停 / 停止对话交人工复核。
  • 迁移注意:不支持 none 推理强度、自定义 temperature/top_p/logprobs;工具调用强制走 Responses API(Chat Completions 需迁移)。

本文为 AI 之家 基于 OpenAI 官方发布说明、平台 changelog 与公开报道整合;模型基准以 GPT-6 Astra 模型卡 为准。

背景与分析

GPT-6 Astra 是 GPT-5.6 Sol 的继任者,但方向明显从「更聪明的对话」转向「能自己把事干完的 agent」。OpenAI 在发布说明里反复强调 "carry complex tasks from an initial request to a finished result"——这意味着模型被设计成在长程、多工具、多步骤工作流里持续推进,而不是每轮等人类喂指令。

配套发布的 Responses API 长程控制能力进一步印证这一点:

  • 异步工具调用(Async tool calling):你的应用跑函数 / 自定义工具时,模型继续工作,结果就绪后回传;
  • 轮次中途引导(Mid-turn steering):WebSocket 进行中可发送补充指令,模型即时纠错或适配变化的需求;
  • 对话中途调整推理强度:困难任务加码、常规追问降档,同时保留已缓存的 prompt 前缀。

这三件套本质上是把「人类在 loop 里」这件事尽量外置——让 agent 在更长的时间跨度里自主运行,仅在关键节点向人确认。

对生态的连锁反应

  • Codex 已切默认模型:GPT-6 Astra 自 v0.153.4(9-3 起) 成为 Codex CLI 的推荐 / 捆绑默认模型,并带来插件分组(OpenAI Curated / Workspace / Shared-with-me)与按线程追踪的 rollout token 预算。见 Codex CLI 工具卡
  • 定价压力:Astra 定价 $10 / $50 每百万 token,是 GPT-5.6 Terra 的约 4 倍,跑量场景成本显著上升;与之对照,同周的 Claude Fable 5.1 把缓存读压到 $0.25/MTok,Gemini 3.8 Flash 维持 $0.75/$3.75 促销价——三家的「旗舰 vs 性价比」分层在 9 月第一周同时成型。
  • 安全能力被刻意门控:Ast 的「Critical」网络安全能力意味着正常安全工作也可能被拒答,企业接入需要做权限、日志、复核流程。

AI 之家 观点

GPT-6 Astra 真正的信号不是跑分,而是 OpenAI 把「长程 agent 控制面」当成了主战场:异步工具调用、中途引导、推理强度热切换,全是在解决「agent 跑太久怎么管」的工程问题。这跟同周 Claude Code v2.1.269 的插件评测与输出风格开关Cursor Projects 的协调 agent 是同一个趋势——2026 下半年的竞争焦点,已经从「谁的模型更强」转向「谁的 agent 系统更能长期稳定跑、成本可控、可被治理」。

对开发者而言有两点要立刻注意:一是 Chat Completions 用户必须迁移到 Responses API 才能用工具调用,技术债要及早还;二是 Astra 的 $10/$50 定价下,非强推理任务应继续用 GPT-5.6 家族或 Flash 档,把 Astra 留给真正需要 computer use 与长程自主性的硬骨头。

相关阅读

来源

相关对比

Aider vs Claude Code:终端 AI 编程双雄怎么选

Aider vs Claude Code 2026 选型对比:开源 BYOK 多模型 vs Anthropic 订阅长任务 Agent,从编程能力、多模型支持、价格、Git 集成、国内可用性和适合人群判断,帮你选对终端 AI 编程工具。

Augment Code vs Cursor:企业 AI 编程怎么选?Context Engine vs AI IDE 对比

Augment Code vs Cursor 2026 选型对比:Context Engine 全仓索引的企业 AI 平台 vs SpaceX 收购的 AI IDE 天花板,从形态、Context 覆盖、长任务、价格、合规、中文支持和适合人群 8 个维度判断,帮你选对企业 AI 编程工具。

Claude Code vs Cline:CLI AI Agent 怎么选?2026 对比

Claude Code vs Cline 2026 选型对比:Anthropic 官方闭源 CLI Agent vs Apache-2.0 开源 VS Code 插件。从模型绑定、工作流、MCP 支持、价格、隐私和适合人群 6 个维度帮你选对 CLI AI 编程工具。

Claude Code vs Codex CLI:终端 AI Agent 双雄对比

Claude Code vs Codex CLI 2026 选型对比:Anthropic 与 OpenAI 两大官方终端 Agent 的模型、长任务、MCP 生态、Windows 支持、订阅打包价格和国内可用性全方位对比,帮你判断该用哪个终端 AI Agent,以及能不能两个一起用。

Claude Code vs Crush:Anthropic 官方 vs 多模型 TUI(2026 实测选型)

Claude Code vs Crush 2026 选型对比:Anthropic 官方 CLI Agent(Claude only + 长任务最稳 + MCP 一等公民)vs Charmbracelet 开源 TUI Agent(多模型 mid-session 切换 + LSP + FSL-1.1-MIT)。从模型、长任务、生态、价格、国内可用性帮你选对终端 AI 编程工具。

Claude Code vs Gemini CLI:终端 AI Agent 怎么选?(2026 选型指南)

Claude Code 和 Gemini CLI 都是终端原生的 AI 编码 Agent。一句话结论 + 决策树 + 价格 + 国内可用性对比:长任务与 CLAUDE.md 生态选前者,免费额度与接入门槛选后者。

相关评测