1 万个智能体跑 88 小时解出千禧年难题:OpenAI 的 Navier-Stokes 证明与「截胡」争议
2026-09-15 · 中国网科技 / 澎湃新闻 / 腾讯新闻 / 21世纪经济报道 / RT
要点
- 2026-09-08 官宣:OpenAI 称其内部一款尚未公开、强于 GPT-6 Astra 的下一代模型,组织约 1 万个 AI 智能体协作,耗时约 88 小时,给出了纳维-斯托克斯(Navier-Stokes)方程存在性与光滑性问题的证明,同步公开 166 页论文与 Lean 定理证明器验证代码。
- 题目分量:这是克雷数学研究所 2000 年设立的七大千禧年难题之一,每题悬赏 100 万美元。七题中此前只有「庞加莱猜想」被解决。OpenAI 表示不会申领奖金。
- 真实时间线:内部模型 8 月 28 日开始训练;首批智能体启动约 88 小时后,系统于 9 月 5 日得到解法;随后 GPT-6 Astra 用 17 小时完成 Lean 形式化。
- 规模数据:整个项目产生约 270 万条消息、约 1300 亿个输出 token,OpenAI 称耗费数百万美元。
- 关键限定:OpenAI 并未证明「无外力解必然光滑」,而是选择克雷题目的 C、D 方向——构造有限且处处光滑的外力,使光滑解不能维持到所有时间。这是争议的技术核心之一。
- 争议:纽约大学数学家 Tristan Buckmaster 与 Anthropic 研究员 Levent Alpoge 同日公开了带光滑外力的欧拉方程有限时间奇点成果(含 Lean 验证)。OpenAI 承认 9 月 1 日听到传闻后启动「并行工作」,承认对方在该问题上领先,但否认看到未发表内容,也不排除两人使用 OpenAI 产品的数据以某种方式优化了底层模型。
- 尚未定论:克雷数学研究所所长 Martin Bridson 通过《新科学家》回应,正式评估仍需时间。以上均为各方公开口径,AI 之家 未做独立数学验证。
后续(2026-09-16 补记):本文发表后,数学界的反弹进一步升级。09-11,包括陶哲轩(Terence Tao)、Peter Scholze、Maryna Viazovska(吴宝珠)、James Maynard、Maxim Kontsevich 在内的 25 位菲尔兹奖得主联名发表《人工智能在数学中的严重错位》(A Severe Misalignment of AI in Mathematics)。联名文章的核心论点不是质疑 AI 的能力,而是质疑评价机制:当实验室把「攻克著名难题」当成 benchmark,证明生成就变成了「批量生产真/假陈述」,反而挤压了写清楚、做引用、把成果吸收进学科体系这些更慢但更重要的人类工作。宣言提出三项倡议:突破后留足同行评审时间、规范引用既有研究、尊重人类研究者的传承作用。联名未点名任何公司,矛头指向的是激励结构。另据公开报道,OpenAI 已于 09-10 撤出对 Caltech Mathathon 的赞助,此前有数学家指控相关实验室存在研究不端。千禧年难题的正式评估仍无结论。
背景与分析
这件事要拆成两层看:一层是「AI 做到了什么」,一层是「它是怎么做到的」。
第一层相对清楚。约 100 个智能体先用约 50 小时做出无外力版本的欧拉方程有限时间爆破解答,OpenAI 把这个中间结果分发给更多智能体作为基础,随后把资源转向纳维-斯托克斯,由 Codex 汇总思路并交叉分发。智能体分组拿到不同题面,可以读缓存互联网、跑代码、组内交流——这已经不是「一个模型在答题」,而是一次带调度、带中间产物复用、带交叉验证的分布式搜索。
第二层才是真正的争议所在。Buckmaster 与 Alpoge 已合作约一年,方向正是带外力的欧拉方程——与纳维-斯托克斯密切相关。他们使用了包括 OpenAI Codex 与 Anthropic Claude 在内的工具推进研究。Buckmaster 质疑的核心是:两人选择的「光滑外力」路线不是把问题直接丢给模型后自然出现的方向,而是建立在数学家 Diego Córdoba 与 Luis Martínez-Zoroa 此前工作基础上的、需要人类判断的路径选择;而 OpenAI 相关模型的第一条提示词,是在获悉两人进展后的几天内输入的。
OpenAI 的回应留了一个很关键的口子:否认看到未发表成果,但承认不能排除匿名产品使用数据参与过模型改进。这句话的分量在于——它把「是否剽窃」从一个个案问题,变成了一个结构性问题:当研究者普遍用同一批商业模型辅助工作时,模型厂商与用户之间的知识边界在哪里?
还有一个更值得注意的点:形式化验证只能验证结果,不能解释过程。Lean 可以确认证明步骤无误,但搜索过程、中间推理、为何选择某条路径的思维过程完全不可见。这正是随后「AI 减速论」发酵时反复被引用的论据——"人类可以通过工具检查形式化结果,但看不懂它是怎么想到的"(21 世纪经济报道语)。
对开发者的影响
- 大规模 Agent 编排已经跑通了「科研级」任务。1 万个智能体、270 万条消息、1300 亿输出 token——这个量级的编排工程(分组、中间产物分发、交叉汇总)本身就是可复用的范式。做 Codex、Claude Code 这类工具的团队,值得关注的是调度层而非模型层。
- 「证明可验证 ≠ 过程可审计」会成为合规硬约束。Lean 验证通过只说明结果对,不说明路径合理。金融、医疗、国防场景引入 Agent 时,审计日志必须记录到「为什么选这条路」的粒度,否则监管不会放行。
- 模型厂商与用户的数据边界要重新谈。Buckmaster 的质疑本质上是:我用你的 Codex 做研究,你的模型会不会从我的会话里学到我的路线?把未发表研究放进商业模型前,先想清楚这个风险。
- 数学/科研类 Agent 的评测标准会变。陶哲轩对此事的评论是 AI「跨界」后好问题将成为稀缺资源——换言之,评估 Agent 的价值不该只看「能不能解出来」,还要看「能不能提出值得解的问题」。
- 别急着把「AI 解决千禧年难题」写进选型 PPT。克雷研究所尚未完成评估,且 OpenAI 选择的是 C、D 方向而非完整的无外力命题。结论待数学界独立检验。
AI 之家 观点
- 这件事真正的里程碑不是「AI 会做数学」,而是「AI 会组织自己做数学」。 单模型刷榜的时代已经过去,2026 年下半年的分水岭是编排能力(orchestration):怎么分组、怎么复用中间结果、怎么交叉验证。谁把这一层工程化,谁就拿到下一阶段的入场券。参考 上下文工程 里讲的那些机制——压缩历史、锚定目标、裁剪工具回包——在这类长程任务里已经不是优化项,而是能不能跑完的决定项。
- 「黑箱危机」不是危言耸听,是可验证的工程现实。 1300 亿 token 换来的结果,人类只能验证不能复现。当 Agent 开始产出人类看不懂但能用的成果时,「结果足够好」这套验收标准就失效了。建议任何把 Agent 接进生产关键路径的团队,现在就把「可解释性预算」算进成本——你要么花钱买可观测性,要么将来花更多钱解释事故。
- 「AI 减速论」与这条新闻是同一枚硬币。 一边是 1 万智能体 88 小时攻克 90 年悬案,一边是三大厂 CEO 同期呼吁给前沿定速——能力越强、过程越不透明,治理压力就越大。对开发者而言,短期影响是算力与 API 成本的不确定性上升,中期影响是合规能力会变成工具选型的一票否决项。
相关阅读
- 相关资讯:AI 减速论:从「前沿定速」到算力股集体下挫 · GPT-6 Astra 发布 · Amodei《我们必须为前沿定速》
- 工具卡:Codex CLI · Claude Code · Devin
- 模型卡:GPT-6 Astra · Claude Fable 5.1
- 概念:AI Agent · 上下文工程 · Agent 记忆 · Vibe Coding
来源
- AI智能体八十八小时解出千禧年难题之一 引起"抢发"数学家成果争议 — 中国网科技
- 被数学家质疑"截胡"成果,OpenAI承认对方领先 — 澎湃新闻
- 调动1万个智能体,OpenAI宣布:解决一个重大数学难题!知名数学家抨击其"抢跑",陶哲轩:AI"跨界",好问题将成稀缺资源 — 腾讯新闻
- OpenAI accused of exaggerating Navier-Stokes AI breakthrough — RT
- "黑箱危机"开始蔓延 "三大厂"齐呼AI减速 — 21世纪经济报道
本资讯由 AI 之家 编辑部根据公开报道整理,非 OpenAI 官方通稿;证明结论仍待克雷数学研究所与数学界独立检验,时间线与各方口径以官方声明为准。