AI DAILY / 2026-09-09
OpenAI未发布模型疑似解决Navier–Stokes:一场千禧难题风波
On the Navier–Stokes Millennium Prize Problem
中文翻译 · AI 生成,仅供学习交流
关于纳维–斯托克斯千禧年奖金难题
OpenAI 交出了一份相当惊人的成果。他们用一款尚未发布的模型,拿下了纳维–斯托克斯存在性与光滑性问题(Navier–Stokes existence and smoothness problem)。该问题是自 2000 年 5 月 24 日起悬赏 100 万美元的七大千禧年奖金难题(Millennium Prize Problems)之一。但这件事的光芒被一桩「搞小动作」的指控盖了过去。指控来自 Tristan Buckmaster(纽约大学数学教授),他此前一直在与 Levent Alpöge(一位卓有成就的数学家,现任职于 Anthropic)合作研究相关问题。Tristan 的控诉伴随着他们自身研究成果的仓促发布。这份 PDF 描述了事情经过。简单版是这样的。Tristan 和 Levent 在这个问题上合作了近一年,大量使用了 Claude 和 Codex(主要是 GPT-5.6 Sol),随后在 8 月 15 日取得了突破。
数学界的传闻机器随即开转。Tristan 和 Levent 听说,OpenAI 那边也听到了传闻,说 Anthropic 已经「解决了一个重大公开问题」,于是主动联系了 OpenAI,结果发现 OpenAI 有一个团队正在用类似的方法研究一个相关问题。Tristan 是这么说的。
> 我问他们第一条提示(prompt)是何时发出的。OpenAI 当时没有直接回答。过了好一阵子,他们才终于承认那条提示是在最近几天才发出来的,而那时,关于我们工作的消息已经传到了 OpenAI。我又问他们的模型有没有在我们的 Codex 会话上做过训练,或者能不能访问这些会话。我们整个项目过程中所有的草稿都放在这些会话里。对方告诉我,模型不会去查找用户数据。我又追问了一次关于训练的事,依然没得到答复。
后面的事情变得更加复杂。OpenAI 团队提出可以等 Tristan 先发表,或者邀请他写一篇关于他们成果的论文,但明确表示,由于 OpenAI 与 Levent 所在的公司存在竞争关系,不会邀请 Levent 作为共同作者。OpenAI 是这样描述他们的工作的。
> 9 月 1 日,星期二,我们听到传闻说有两个千禧年奖金难题已经被解决。受这些传闻以及我们内部模型性能跨越式提升的启发,我们启动了一项工作,用模型去评估所有尚未解决的千禧年奖金难题,以及其他一些高影响力的问题。[……] 智能体(agent)在 9 月 5 日,星期六,给出了解答,距离第一批智能体启动大约过去了 88 个小时。基于 GPT‑6 Astra 的 Lean 形式化与验证又额外花了 17 个小时。在所有尝试过的问题上,智能体总共发送了 490 万条消息,消耗了约 3000 亿个输出 token。在解决纳维–斯托克斯问题的过程中,智能体发送了 270 万条消息,消耗了约 1300 亿个输出 token。(我们并不知道他们使用的内部模型的计费方式。但如果按 GPT-6 Astra 的公开 API 价格计算,3000 亿个输出 token 大约要花掉 1500 万美元。)
OpenAI 对 Tristan 和 Levent 的工作是这么回应的(粗体为我所加)。
> 我们的工作于 9 月 1 日开始,缘于听到的一则传闻。我们后来才意识到,这则传闻与 Levent Alpöge(Anthropic 员工)和 Tristan Buckmaster(纽约大学数学教授)有关。在我们完成整个项目并完成 Lean 验证之后(9 月 6 日),基于那则传闻我们以为他们可能也解决了纳维–斯托克斯问题,于是主动联系了他们,提出同步发布我们的结果,并在联合声明中承认他们的优先权。[……] 我们(研究者和智能体)此前通过任何方式都没看到过他们的工作。特别是,我们并没有访问任何具体的用户数据来求解这个问题。虽然可能性不大,但我们无法排除这样一种情况,来自他们使用我们产品的去标识化数据,可能间接帮助改进了我们的模型。不过,我们的证明差异很大,即便在欧拉(Euler)情形中,所证明的具体结果也不一样(强迫情形 vs 非强迫情形)。
我对这件事的理解是这样的。OpenAI 听说一些千禧年奖金难题已经被用大语言模型(LLM)解决了,于是把这当作展示自家最新模型实力的契机,却没怎么考虑抢先发表一个已经用 OpenAI 自己的模型研究了将近一年的团队会带来什么观感(译注:optics 在此指「观感」或「形象上的影响」,即抢先发布在公众和当事人看来意味着)。这情形与当下计算机安全领域正在发生的事情如出一辙。Anil Madhavapeddy 最近指出,现如今,「仅仅是某个漏洞的传闻就足以让人找到安全漏洞」,因为只要有人知道某款软件存在未修补的漏洞,就可以让自己的智能体去找出它。数学界是不是也变成了这样?仅仅是知道某个问题已经存在一个未发表的解法,就可能引发数百万美元的大语言模型投入,以求抢先一步。
这还凸显出我一直以来对这一切运作方式感到的某种不满。当一家 AI 实验室说我的数据被「用于改进模型表现」时,这到底是什么意思?我过去最喜欢提的两个假设性问题。
> 如果我在用 Codex 时,我的一个 API 密钥不小心被放进了上下文里,那么未来其他人请求 API 密钥时,有多大几率会拿到我那个?我曾经问过 OpenAI 的某个人这个问题。他们称之为「反刍」(regurgitation)问题(译注:regurgitation 字面意为「反刍」,在 AI 圈特指模型在生成时无意中复现训练数据中的原始内容),并向我保证他们会非常谨慎地防止这种情况发生……但并没有具体说明是怎么做的。
>
> 如果我和 ChatGPT 头脑风暴,探讨我所在公司潜在的新方向,那么这些信息有多大概率会暴露给竞争对手