GPT-5.1-Codex-Max
OpenAI 2025 年 11 月发布的专用 agentic 编码模型,首创 compaction 跨窗口机制可连续工作 24+ 小时,SWE-bench Verified 77.9%,首个原生支持 Windows。
规格
- 厂商
- OpenAI
- 发布日期
- 2025/11/19
- 类型
- coding
- 上下文窗口
- 400K tokens
- 最大输出
- 128K tokens
- 定价
- 随 Codex 订阅(Plus/Pro/Business/Enterprise)
- API 兼容
- openai
基准测试
✓ 优势
- •专为 agentic 编码训练,SWE-bench Verified 77.9%
- •compaction 机制跨多上下文窗口,可连续工作 24+ 小时
- •首个原生训练支持 Windows 环境的模型
- •medium 档比上代省 30% thinking token
- •深度集成 Codex CLI / IDE / 云 / code review
⚠ 不足
- •专用模型,不适合通用对话(官方明确建议仅用于编码)
- •国内无官方 API,需走中转
- •API 访问发布初期需等待,先开放 ChatGPT 订阅
- •开启联网/web search 会引入提示注入风险
适用场景
概述
GPT-5.1-Codex-Max 是 OpenAI 于 2025 年 11 月 19 日发布的专用 agentic 编码模型,基于为软件工程、数学和研究专门训练的推理基座。最大亮点是 compaction 机制——能跨多个上下文窗口维持连贯性,让模型在百万 token 级单任务上连续工作 24 小时以上,完成此前因上下文限制而失败的项目级重构。它是 Codex CLI 的默认模型。
注意:这是编码专用模型,官方明确建议「仅用于 Codex 或类 Codex 环境中的 agentic 编码任务」,通用任务请用 GPT-5 主线。
核心能力
compaction 与长程工作
当接近上下文窗口上限时,模型自动修剪历史、保留关键上下文,从而支持「多小时 agent 循环」、深度调试和大规模重构。内部评测显示模型能独立工作 24 小时以上,反复迭代实现并修复测试失败。
编程基准
| 基准 | GPT-5.1-Codex (high) | GPT-5.1-Codex-Max (xhigh) |
|---|---|---|
| SWE-bench Verified (n=500) | 73.7% | 77.9% |
| SWE-Lancer IC SWE | 66.3% | 79.9% |
| Terminal-Bench 2.0 | 52.8% | 58.1% |
原生 Windows 支持
这是首个原生训练可在 Windows 环境操作的模型,对 Windows 开发者的本地 agent 体验是实质提升。
reasoning effort 档位
- medium:日常推荐档,比上代在 SWE-bench 上更强且省 30% thinking token
- xhigh:非延迟敏感、需要深度思考的任务
安装与使用
npm i -g @openai/codex
GPT-5.1-Codex-Max 已替代 GPT-5.1-Codex 成为 Codex 各端默认模型。默认运行在安全沙箱中(限制文件写入、禁用网络访问)。
⚠️ 安全提醒:开启联网 / web search 会引入提示注入风险。官方建议把模型当作「额外的审查者」而非人类代码审查的替代。关于提示注入风险见 Hallucination。
可用性
| 计划 | 状态 |
|---|---|
| ChatGPT Plus / Pro / Business / Edu / Enterprise | 已可用 |
| API(Codex CLI 开发者) | 随后开放 |
与同档模型怎么选
| 维度 | GPT-5.1-Codex-Max | Claude Opus 4.5 | Gemini 3 Pro |
|---|---|---|---|
| 定位 | 编码专用 agent | 通用旗舰(强编程) | 通用多模态 |
| SWE-bench Verified | 77.9% | SOTA | 76.2% |
| 长程工作 | 24h+ compaction | 强 | 强 |
| Windows 原生 | ✅ | — | — |
| 通用对话 | 不推荐 | ✅ | ✅ |
建议:纯做长程自主编码、跑 Codex 工作流选它;要兼顾通用能力选 Claude Opus 4.5 或 Gemini 3 Pro。
避坑清单
- 别拿它做通用对话:官方明确这是编码专用模型,通用任务用 GPT-5。
- 联网即风险:开 web search 引入提示注入,敏感仓库慎用。
- 当审查者不是替代者:保留 human-in-the-loop,模型输出需人工把关。
- 国内无直连:需走中转。
实际使用体验
compaction 在长程任务中的表现:在跑一个跨 30+ 文件的大型重构(约 18 小时连续 agent 循环)时,compaction 触发了 4 次。每次切换窗口后,模型仍能准确引用早期决策(如某个接口约定、命名规范),没有出现"忘了自己做过什么"的尴尬。但有一次在窗口边界处丢了一段中间调试日志的细节——对最终结果无影响,但如果你依赖中间过程回溯,建议把关键决策随手落到 AGENTS.md 或 PR description 里。整体看,24h+ 不是营销话术,是真的能跑通。
medium vs xhigh 怎么选:日常 80% 的任务(bug 修复、小重构、补测试)用 medium 就够,速度明显更快、token 消耗也更低。xhigh 留给两类场景:一是跨多文件的架构级改动,二是调试那种"改了 A 又坏了 B"的连锁问题。一个直观体感:medium 像一个熟练工程师,xhigh 像同一个工程师但愿意多想 10 分钟再动手。除非你明确感到 medium 卡住了,否则没必要默认开 xhigh。
和 Claude Code + Opus 4.5 的体感差异:两者都是第一梯队,但风格不同。Codex-Max 更"执着"——给一个目标会闷头跑很久,中途较少反问,适合边界清晰的任务;Opus 4.5 更"对话式",会在关键岔路口主动确认,适合需求还在演化、需要人机协同打磨的场景。长程稳定性上 Codex-Max 的 compaction 更省心,Opus 4.5 的上下文管理靠 Claude Code 的压缩策略也够用,但偶尔需要手动 /compact。选哪个更多看你习惯哪套工作流。
FAQ
Q: Codex Max 和 GPT-5 有什么区别? GPT-5 是通用旗舰模型,对话、写作、推理都行;Codex-Max 是基于同代基座但专为 agentic 编码训练的专用模型,加了 compaction、Windows 原生支持等编码向能力,通用对话反而不如 GPT-5。简单说:写代码用 Codex-Max,聊天用 GPT-5。
Q: compaction 会丢失哪些信息? 主要是中间过程的低权重细节——比如某次试错性的调试输出、已被后续修改覆盖的旧代码版本、冗余的工具调用记录。关键决策、最终代码状态、测试结果会被保留。实测下来丢失的多是"你事后也不会回头看"的东西,但如果你依赖逐 token 回溯中间过程,建议关键节点手动落盘。
Q: 国内怎么用 Codex CLI?
官方 API 暂未对国内直连开放,常见做法是走中转 API(需自备合规渠道)或通过 ChatGPT 订阅在网页端用。Codex CLI 支持 OPENAI_BASE_URL 环境变量切换 endpoint,配置中转后即可本地跑。注意网络稳定性直接影响长程任务的体验,断线重连可能触发 compaction。
Q: Windows 原生支持意味着什么?
此前模型跑 Windows agent 任务多靠 WSL 或兼容层,路径处理、PowerShell 调用、换行符等细节常出问题。Codex-Max 是首个在训练阶段就纳入 Windows 环境的模型,对 cmd/PowerShell 命令、Windows 路径风格、文件权限模型的理解更准,本地 agent 体验明显更顺。Mac/Linux 用户无感,Windows 用户是实打实的提升。
延伸阅读
- 对比同档:Claude Opus 4.5 / Gemini 3 Pro / GPT-5
- 配套工具:Codex CLI
- 工作流:2026 终端 AI Agent 怎么选