跳到主内容

OpenAI 发布 Agents API 公测:把 Codex 的 agent harness 托管出来,一次 API 调用起一个云 agent

2026-09-13 · OpenAI 官方 / OpenAI Developer Community / GenAI Daily

要点

  • Agents API 进入 public beta:把驱动 Codex 与 ChatGPT for Work 的 harness 与基础设施,通过一个简单的 API 开放给所有开发者。
  • 核心对象是四个agent(模型 + 指令 + 工具)、environment(代码在哪台机器上跑)、session(跨任务的持久会话)、event stream(执行过程回传的事件流)。
  • 环境三选一:OpenAI 托管沙箱、自托管(自有基础设施 / VPC)、或八家沙箱合作方——Blaxel、Cloudflare Dev、Daytona、DigitalOcean、E2B、Modal、Oracle、Runloop、Vercel。
  • harness 内置三项能力:自动上下文压缩(接近上限时保留关键信息,让 agent 跑几小时乃至几天)、tool search(按需加载工具定义,省 token)、原生 subagent(multi_agent.enabledmax_concurrent_subagents)。
  • 收费与限制:API 本身不额外收费,只付 token、工具与容器费用;公测阶段数据处理留在美国,且不支持零数据保留(ZDR),即使自托管沙箱也一样。

背景与分析

过去两年,写 agent 的门槛从「能不能调模型」变成了「怎么让一个 agent 在生产的第 40 个小时还活着」。LangGraph、CrewAI 这类框架解决了编排的组装问题,但会话持久化、上下文压缩、崩溃恢复、子 agent 协调这套运行时负担,仍然压在每个团队自己身上。

OpenAI 这次的做法是把自己在 Codex 上跑通的那套 harness 直接托管出来,只留三样东西给开发者自己定义:指令、工具(含 MCP server)、执行环境

一个最小示例(官方 quickstart 形态):

const session = await client.beta.agents.sessions.create({
  agent: {
    model: "gpt-6-astra",
    tools: [{ type: "mcp", server_label: "observability", transport: { type: "http", server_url: "https://observability.example.com/mcp" } }],
    multi_agent: { enabled: true, max_concurrent_subagents: 3 },
  },
  vault_ids: ["vault_YOUR_VAULT_ID"],
  environment: { type: "openai_hosted", capability_directories: ["/workspace/capabilities/skills"] },
  input: "Investigate service-api's elevated 5xx rate over the last 30 minutes...",
});

值得注意的是 harness 来自开源 Codex 代码库——开发者可以直接读它怎么管理工具、记忆与上下文,而不是面对一个黑盒。这给了一条很实际的退路:不想锁定托管服务,就自己部署开源 harness。

OpenAI 公布的早期客户数据(均为客户自述,非第三方复现):Ciridae 称评测分数从 0.71 升到 0.85、subagent 工作流延迟降到 1/4;SafetyKit 称案件审查流程单案成本下降 60%;Hypha 称把 harness 与沙箱分离后,失败的 agent 响应减少 86%。

对开发者的影响

  • 正面:长时运行 agent 的运维成本被大幅外包。自动上下文压缩、崩溃恢复、subagent 并行这三块,是多数团队自研时最容易做砸的部分。
  • 代价:编排层锁定在 OpenAI 的实现上,并且要跟着它的模型与 harness 版本迭代。对「跨模型 provider」的产品来说,更现实的选择是直接用 GitHub 上的开源 Codex harness,而不是托管 API。
  • 合规红线:公测期不支持 ZDR、数据处理在美国。金融、医疗、政务这类有数据驻留要求的团队,短期内只能走自托管沙箱路径,但要接受数据仍可能出境这一点——这是选型前必须问清的一条。
  • 成本模型变化:容器按时计费是新增科目。有开发者在社区提醒,第一次用托管沙箱要先算清容器成本再批量起容器。

AI 之家 观点

这件事的行业含义大于产品含义:agent 竞争的战场正式从「模型」挪到了「harness + 执行环境」

  1. harness 正在被商品化。OpenAI 把自己的核心 harness 开源并托管,等于告诉市场:编排层不再是差异化来源,差异在工具、数据与工作流。这会直接压到 DifyCoze、CrewAI 这类「组装型」平台的定价逻辑。
  2. 执行环境成了新的护城河。OpenAI 拉了八家沙箱合作方,Cursor 同期也上线 Self-Hosted Machines(AWS Lambda / Cloudflare / Modal / Vercel / E2B 等)。两边指向同一个结论:代码在哪跑、密钥留在谁的机房,是企业采购的第一问题
  3. 短期最大风险不是能力,是数据驻留。不支持 ZDR 这一条,会让相当一部分国内与欧洲合规场景暂时无法上托管版;自托管 + 开源 harness 会是这一段时间的现实解法。

给团队的判断建议:如果你的差异化在业务工具与数据,用托管 Agents API 换速度是划算的;如果你要做的是跨模型、可迁移的 agent 平台,就别把编排层交给任何一家模型厂商。

相关阅读

来源

相关对比

Augment Code vs Cursor:企业 AI 编程怎么选?Context Engine vs AI IDE 对比

Augment Code vs Cursor 2026 选型对比:Context Engine 全仓索引的企业 AI 平台 vs SpaceX 收购的 AI IDE 天花板,从形态、Context 覆盖、长任务、价格、合规、中文支持和适合人群 8 个维度判断,帮你选对企业 AI 编程工具。

Claude Code vs Codex CLI:终端 AI Agent 双雄对比

Claude Code vs Codex CLI 2026 选型对比:Anthropic 与 OpenAI 两大官方终端 Agent 的模型、长任务、MCP 生态、Windows 支持、订阅打包价格和国内可用性全方位对比,帮你判断该用哪个终端 AI Agent,以及能不能两个一起用。

Codex CLI vs Crush:OpenAI 官方 vs 多模型 TUI(2026 实测选型)

Codex CLI vs Crush 2026 选型对比:OpenAI 官方终端 Coding Agent(GPT-5.6 + Windows 原生沙箱 + Apache-2.0)vs Charmbracelet 开源 TUI Agent(多模型 mid-session 切换 + LSP + FSL-1.1-MIT)。从模型、平台、生态、价格、国内可用性帮你选对终端 AI 编程工具。

Codex CLI vs Gemini CLI:两家大厂终端 Agent 怎么选?(2026 选型)

OpenAI Codex CLI 与 Google Gemini CLI 的正面比较:一句话结论 + 决策树 + 价格 + 国内可用性。已有 ChatGPT 账号选 Codex,想零成本起步选 Gemini CLI。

Coze vs Dify:AI Agent 平台怎么选?零代码 vs 开源全控对比

Coze vs Dify 2026 选型对比:字节零代码 Bot 平台 vs 开源 LLMOps 全控平台,从平台定位、开发体验、工作流编排、RAG 精度、私有部署、价格模型和适合人群 7 个维度判断,帮你选对 AI Agent 平台。

Coze vs FastGPT:AI 知识库平台怎么选?Bot 工厂 vs RAG 专精对比

Coze vs FastGPT 2026 选型对比:字节零代码 Bot 平台 vs labring 开源 RAG 专精平台,从平台定位、开发体验、RAG 精度、工作流编排、模型生态、私有部署、价格模型和适合人群 8 个维度判断,帮你选对 AI 知识库平台。

相关评测