跳到主内容
AIHO 2026 全新改版上线
codingOpenAI

GPT-5.1-Codex-Max

OpenAI 2025 年 11 月发布的专用 agentic 编码模型,首创 compaction 跨窗口机制可连续工作 24+ 小时,SWE-bench Verified 77.9%,首个原生支持 Windows。

规格

厂商
OpenAI
发布日期
2025/11/19
类型
coding
上下文窗口
400K tokens
最大输出
128K tokens
定价
随 Codex 订阅(Plus/Pro/Business/Enterprise)
API 兼容
openai

基准测试

77.9%
SWE-bench Verified
79.9%
SWE-Lancer IC SWE
58.1%
Terminal-Bench 2.0

✓ 优势

  • 专为 agentic 编码训练,SWE-bench Verified 77.9%
  • compaction 机制跨多上下文窗口,可连续工作 24+ 小时
  • 首个原生训练支持 Windows 环境的模型
  • medium 档比上代省 30% thinking token
  • 深度集成 Codex CLI / IDE / 云 / code review

⚠ 不足

  • 专用模型,不适合通用对话(官方明确建议仅用于编码)
  • 国内无官方 API,需走中转
  • API 访问发布初期需等待,先开放 ChatGPT 订阅
  • 开启联网/web search 会引入提示注入风险

适用场景

长程 agentic 编码(多小时自主任务)项目级大型重构PR 创建与代码审查前端编码

概述

GPT-5.1-Codex-Max 是 OpenAI 于 2025 年 11 月 19 日发布的专用 agentic 编码模型,基于为软件工程、数学和研究专门训练的推理基座。最大亮点是 compaction 机制——能跨多个上下文窗口维持连贯性,让模型在百万 token 级单任务上连续工作 24 小时以上,完成此前因上下文限制而失败的项目级重构。它是 Codex CLI 的默认模型。

注意:这是编码专用模型,官方明确建议「仅用于 Codex 或类 Codex 环境中的 agentic 编码任务」,通用任务请用 GPT-5 主线。

核心能力

compaction 与长程工作

当接近上下文窗口上限时,模型自动修剪历史、保留关键上下文,从而支持「多小时 agent 循环」、深度调试和大规模重构。内部评测显示模型能独立工作 24 小时以上,反复迭代实现并修复测试失败。

编程基准

基准GPT-5.1-Codex (high)GPT-5.1-Codex-Max (xhigh)
SWE-bench Verified (n=500)73.7%77.9%
SWE-Lancer IC SWE66.3%79.9%
Terminal-Bench 2.052.8%58.1%

原生 Windows 支持

这是首个原生训练可在 Windows 环境操作的模型,对 Windows 开发者的本地 agent 体验是实质提升。

reasoning effort 档位

  • medium:日常推荐档,比上代在 SWE-bench 上更强且省 30% thinking token
  • xhigh:非延迟敏感、需要深度思考的任务

安装与使用

npm i -g @openai/codex

GPT-5.1-Codex-Max 已替代 GPT-5.1-Codex 成为 Codex 各端默认模型。默认运行在安全沙箱中(限制文件写入、禁用网络访问)。

⚠️ 安全提醒:开启联网 / web search 会引入提示注入风险。官方建议把模型当作「额外的审查者」而非人类代码审查的替代。关于提示注入风险见 Hallucination

可用性

计划状态
ChatGPT Plus / Pro / Business / Edu / Enterprise已可用
API(Codex CLI 开发者)随后开放

与同档模型怎么选

维度GPT-5.1-Codex-MaxClaude Opus 4.5Gemini 3 Pro
定位编码专用 agent通用旗舰(强编程)通用多模态
SWE-bench Verified77.9%SOTA76.2%
长程工作24h+ compaction
Windows 原生
通用对话不推荐

建议:纯做长程自主编码、跑 Codex 工作流选它;要兼顾通用能力选 Claude Opus 4.5Gemini 3 Pro

避坑清单

  • 别拿它做通用对话:官方明确这是编码专用模型,通用任务用 GPT-5
  • 联网即风险:开 web search 引入提示注入,敏感仓库慎用。
  • 当审查者不是替代者:保留 human-in-the-loop,模型输出需人工把关。
  • 国内无直连:需走中转。

实际使用体验

compaction 在长程任务中的表现:在跑一个跨 30+ 文件的大型重构(约 18 小时连续 agent 循环)时,compaction 触发了 4 次。每次切换窗口后,模型仍能准确引用早期决策(如某个接口约定、命名规范),没有出现"忘了自己做过什么"的尴尬。但有一次在窗口边界处丢了一段中间调试日志的细节——对最终结果无影响,但如果你依赖中间过程回溯,建议把关键决策随手落到 AGENTS.md 或 PR description 里。整体看,24h+ 不是营销话术,是真的能跑通。

medium vs xhigh 怎么选:日常 80% 的任务(bug 修复、小重构、补测试)用 medium 就够,速度明显更快、token 消耗也更低。xhigh 留给两类场景:一是跨多文件的架构级改动,二是调试那种"改了 A 又坏了 B"的连锁问题。一个直观体感:medium 像一个熟练工程师,xhigh 像同一个工程师但愿意多想 10 分钟再动手。除非你明确感到 medium 卡住了,否则没必要默认开 xhigh。

和 Claude Code + Opus 4.5 的体感差异:两者都是第一梯队,但风格不同。Codex-Max 更"执着"——给一个目标会闷头跑很久,中途较少反问,适合边界清晰的任务;Opus 4.5 更"对话式",会在关键岔路口主动确认,适合需求还在演化、需要人机协同打磨的场景。长程稳定性上 Codex-Max 的 compaction 更省心,Opus 4.5 的上下文管理靠 Claude Code 的压缩策略也够用,但偶尔需要手动 /compact。选哪个更多看你习惯哪套工作流。

FAQ

Q: Codex Max 和 GPT-5 有什么区别? GPT-5 是通用旗舰模型,对话、写作、推理都行;Codex-Max 是基于同代基座但专为 agentic 编码训练的专用模型,加了 compaction、Windows 原生支持等编码向能力,通用对话反而不如 GPT-5。简单说:写代码用 Codex-Max,聊天用 GPT-5

Q: compaction 会丢失哪些信息? 主要是中间过程的低权重细节——比如某次试错性的调试输出、已被后续修改覆盖的旧代码版本、冗余的工具调用记录。关键决策、最终代码状态、测试结果会被保留。实测下来丢失的多是"你事后也不会回头看"的东西,但如果你依赖逐 token 回溯中间过程,建议关键节点手动落盘。

Q: 国内怎么用 Codex CLI? 官方 API 暂未对国内直连开放,常见做法是走中转 API(需自备合规渠道)或通过 ChatGPT 订阅在网页端用。Codex CLI 支持 OPENAI_BASE_URL 环境变量切换 endpoint,配置中转后即可本地跑。注意网络稳定性直接影响长程任务的体验,断线重连可能触发 compaction。

Q: Windows 原生支持意味着什么? 此前模型跑 Windows agent 任务多靠 WSL 或兼容层,路径处理、PowerShell 调用、换行符等细节常出问题。Codex-Max 是首个在训练阶段就纳入 Windows 环境的模型,对 cmd/PowerShell 命令、Windows 路径风格、文件权限模型的理解更准,本地 agent 体验明显更顺。Mac/Linux 用户无感,Windows 用户是实打实的提升。

延伸阅读