跳到主内容

1 万个智能体跑 88 小时解出千禧年难题:OpenAI 的 Navier-Stokes 证明与「截胡」争议

2026-09-15 · 中国网科技 / 澎湃新闻 / 腾讯新闻 / 21世纪经济报道 / RT

要点

  • 2026-09-08 官宣:OpenAI 称其内部一款尚未公开、强于 GPT-6 Astra 的下一代模型,组织约 1 万个 AI 智能体协作,耗时约 88 小时,给出了纳维-斯托克斯(Navier-Stokes)方程存在性与光滑性问题的证明,同步公开 166 页论文Lean 定理证明器验证代码
  • 题目分量:这是克雷数学研究所 2000 年设立的七大千禧年难题之一,每题悬赏 100 万美元。七题中此前只有「庞加莱猜想」被解决。OpenAI 表示不会申领奖金
  • 真实时间线:内部模型 8 月 28 日开始训练;首批智能体启动约 88 小时后,系统于 9 月 5 日得到解法;随后 GPT-6 Astra 用 17 小时完成 Lean 形式化
  • 规模数据:整个项目产生约 270 万条消息、约 1300 亿个输出 token,OpenAI 称耗费数百万美元
  • 关键限定:OpenAI 并未证明「无外力解必然光滑」,而是选择克雷题目的 C、D 方向——构造有限且处处光滑的外力,使光滑解不能维持到所有时间。这是争议的技术核心之一。
  • 争议:纽约大学数学家 Tristan Buckmaster 与 Anthropic 研究员 Levent Alpoge 同日公开了带光滑外力的欧拉方程有限时间奇点成果(含 Lean 验证)。OpenAI 承认 9 月 1 日听到传闻后启动「并行工作」,承认对方在该问题上领先,但否认看到未发表内容,也不排除两人使用 OpenAI 产品的数据以某种方式优化了底层模型。
  • 尚未定论:克雷数学研究所所长 Martin Bridson 通过《新科学家》回应,正式评估仍需时间。以上均为各方公开口径,AI 之家 未做独立数学验证

后续(2026-09-16 补记):本文发表后,数学界的反弹进一步升级。09-11,包括陶哲轩(Terence Tao)、Peter Scholze、Maryna Viazovska(吴宝珠)、James Maynard、Maxim Kontsevich 在内的 25 位菲尔兹奖得主联名发表《人工智能在数学中的严重错位》(A Severe Misalignment of AI in Mathematics)。联名文章的核心论点不是质疑 AI 的能力,而是质疑评价机制:当实验室把「攻克著名难题」当成 benchmark,证明生成就变成了「批量生产真/假陈述」,反而挤压了写清楚、做引用、把成果吸收进学科体系这些更慢但更重要的人类工作。宣言提出三项倡议:突破后留足同行评审时间、规范引用既有研究、尊重人类研究者的传承作用。联名未点名任何公司,矛头指向的是激励结构。另据公开报道,OpenAI 已于 09-10 撤出对 Caltech Mathathon 的赞助,此前有数学家指控相关实验室存在研究不端。千禧年难题的正式评估仍无结论。

背景与分析

这件事要拆成两层看:一层是「AI 做到了什么」,一层是「它是怎么做到的」。

第一层相对清楚。约 100 个智能体先用约 50 小时做出无外力版本的欧拉方程有限时间爆破解答,OpenAI 把这个中间结果分发给更多智能体作为基础,随后把资源转向纳维-斯托克斯,由 Codex 汇总思路并交叉分发。智能体分组拿到不同题面,可以读缓存互联网、跑代码、组内交流——这已经不是「一个模型在答题」,而是一次带调度、带中间产物复用、带交叉验证的分布式搜索

第二层才是真正的争议所在。Buckmaster 与 Alpoge 已合作约一年,方向正是带外力的欧拉方程——与纳维-斯托克斯密切相关。他们使用了包括 OpenAI Codex 与 Anthropic Claude 在内的工具推进研究。Buckmaster 质疑的核心是:两人选择的「光滑外力」路线不是把问题直接丢给模型后自然出现的方向,而是建立在数学家 Diego Córdoba 与 Luis Martínez-Zoroa 此前工作基础上的、需要人类判断的路径选择;而 OpenAI 相关模型的第一条提示词,是在获悉两人进展后的几天内输入的。

OpenAI 的回应留了一个很关键的口子:否认看到未发表成果,但承认不能排除匿名产品使用数据参与过模型改进。这句话的分量在于——它把「是否剽窃」从一个个案问题,变成了一个结构性问题:当研究者普遍用同一批商业模型辅助工作时,模型厂商与用户之间的知识边界在哪里?

还有一个更值得注意的点:形式化验证只能验证结果,不能解释过程。Lean 可以确认证明步骤无误,但搜索过程、中间推理、为何选择某条路径的思维过程完全不可见。这正是随后「AI 减速论」发酵时反复被引用的论据——"人类可以通过工具检查形式化结果,但看不懂它是怎么想到的"(21 世纪经济报道语)。

对开发者的影响

  • 大规模 Agent 编排已经跑通了「科研级」任务。1 万个智能体、270 万条消息、1300 亿输出 token——这个量级的编排工程(分组、中间产物分发、交叉汇总)本身就是可复用的范式。做 CodexClaude Code 这类工具的团队,值得关注的是调度层而非模型层。
  • 「证明可验证 ≠ 过程可审计」会成为合规硬约束。Lean 验证通过只说明结果对,不说明路径合理。金融、医疗、国防场景引入 Agent 时,审计日志必须记录到「为什么选这条路」的粒度,否则监管不会放行。
  • 模型厂商与用户的数据边界要重新谈。Buckmaster 的质疑本质上是:我用你的 Codex 做研究,你的模型会不会从我的会话里学到我的路线?把未发表研究放进商业模型前,先想清楚这个风险。
  • 数学/科研类 Agent 的评测标准会变。陶哲轩对此事的评论是 AI「跨界」后好问题将成为稀缺资源——换言之,评估 Agent 的价值不该只看「能不能解出来」,还要看「能不能提出值得解的问题」。
  • 别急着把「AI 解决千禧年难题」写进选型 PPT。克雷研究所尚未完成评估,且 OpenAI 选择的是 C、D 方向而非完整的无外力命题。结论待数学界独立检验。

AI 之家 观点

  1. 这件事真正的里程碑不是「AI 会做数学」,而是「AI 会组织自己做数学」。 单模型刷榜的时代已经过去,2026 年下半年的分水岭是编排能力(orchestration):怎么分组、怎么复用中间结果、怎么交叉验证。谁把这一层工程化,谁就拿到下一阶段的入场券。参考 上下文工程 里讲的那些机制——压缩历史、锚定目标、裁剪工具回包——在这类长程任务里已经不是优化项,而是能不能跑完的决定项
  2. 「黑箱危机」不是危言耸听,是可验证的工程现实。 1300 亿 token 换来的结果,人类只能验证不能复现。当 Agent 开始产出人类看不懂但能用的成果时,「结果足够好」这套验收标准就失效了。建议任何把 Agent 接进生产关键路径的团队,现在就把「可解释性预算」算进成本——你要么花钱买可观测性,要么将来花更多钱解释事故。
  3. 「AI 减速论」与这条新闻是同一枚硬币。 一边是 1 万智能体 88 小时攻克 90 年悬案,一边是三大厂 CEO 同期呼吁给前沿定速——能力越强、过程越不透明,治理压力就越大。对开发者而言,短期影响是算力与 API 成本的不确定性上升,中期影响是合规能力会变成工具选型的一票否决项

相关阅读

来源

本资讯由 AI 之家 编辑部根据公开报道整理,非 OpenAI 官方通稿;证明结论仍待克雷数学研究所与数学界独立检验,时间线与各方口径以官方声明为准。

相关对比

Aider vs Claude Code:终端 AI 编程双雄怎么选

Aider vs Claude Code 2026 选型对比:开源 BYOK 多模型 vs Anthropic 订阅长任务 Agent,从编程能力、多模型支持、价格、Git 集成、国内可用性和适合人群判断,帮你选对终端 AI 编程工具。

Claude Code vs Cline:CLI AI Agent 怎么选?2026 对比

Claude Code vs Cline 2026 选型对比:Anthropic 官方闭源 CLI Agent vs Apache-2.0 开源 VS Code 插件。从模型绑定、工作流、MCP 支持、价格、隐私和适合人群 6 个维度帮你选对 CLI AI 编程工具。

Claude Code vs Codex CLI:终端 AI Agent 双雄对比

Claude Code vs Codex CLI 2026 选型对比:Anthropic 与 OpenAI 两大官方终端 Agent 的模型、长任务、MCP 生态、Windows 支持、订阅打包价格和国内可用性全方位对比,帮你判断该用哪个终端 AI Agent,以及能不能两个一起用。

Claude Code vs Crush:Anthropic 官方 vs 多模型 TUI(2026 实测选型)

Claude Code vs Crush 2026 选型对比:Anthropic 官方 CLI Agent(Claude only + 长任务最稳 + MCP 一等公民)vs Charmbracelet 开源 TUI Agent(多模型 mid-session 切换 + LSP + FSL-1.1-MIT)。从模型、长任务、生态、价格、国内可用性帮你选对终端 AI 编程工具。

Claude Code vs Gemini CLI:终端 AI Agent 怎么选?(2026 选型指南)

Claude Code 和 Gemini CLI 都是终端原生的 AI 编码 Agent。一句话结论 + 决策树 + 价格 + 国内可用性对比:长任务与 CLAUDE.md 生态选前者,免费额度与接入门槛选后者。

Codex CLI vs Crush:OpenAI 官方 vs 多模型 TUI(2026 实测选型)

Codex CLI vs Crush 2026 选型对比:OpenAI 官方终端 Coding Agent(GPT-5.6 + Windows 原生沙箱 + Apache-2.0)vs Charmbracelet 开源 TUI Agent(多模型 mid-session 切换 + LSP + FSL-1.1-MIT)。从模型、平台、生态、价格、国内可用性帮你选对终端 AI 编程工具。

相关评测