AI DAILY / 2026-09-10
OpenAI据称用约一万个智能体八十八小时求解纳维-斯托克斯奇点问题
[AINews] OpenAI reports Navier-Stokes singularity find in 88 hours using Astra-next, roughly 10,000 agents and 130B tokens (>$40M), a contender for second ever Millennium Prize awarded
全文中文翻译 · AI 生成,仅供学习交流
[AINews] OpenAI 报告称使用 Astra-next 在 88 小时内发现 Navier–Stokes 奇点(singularity),约动用 10,000 个 agent 与 130B tokens(耗资超过 4000 万美元),有望角逐史上第二个千禧年难题奖(Millennium Prize)
风头盖过 Cognition 48 亿美元 E 轮、Mistral 24 亿美元 D 轮、Meta 的 Muse agent 以及 GPT Image 2.5。这是 AI 史上最满、最让人真切感受到 AGI 的一天。
2026 年 9 月 9 日 · 付费内容今天对任何想发布新消息的人来说都是艰难的新闻周期。我们一般承诺会报道任何新的十角兽(译注:英文「decacorn」,指估值超 100 亿美元的初创公司)融资,所以 Cognition 48 亿美元和 Mistral 24 亿美元的轮次本该单独成篇。我们钟爱图像生成,GPT Image 2.5 本应独占一条头条。我们一直密切跟踪 Dreamer 的故事,他们以 Meta 的 Muse agent 身份重新亮相也本该上榜。但…你也知道…现在的门槛已经不一样了。
> OpenAI@OpenAI
> 我们正在分享纳维-斯托克斯(Navier–Stokes)千禧年难题的解答方案,这是数学最前沿最深奥的问题之一。
>
> 该证明由一群 agent 协作产出,使用了一个 OpenAI 下一代模型,其能力远超 GPT-6 Astra。
>
> 问题……
>
>
AI News for 9/7/2026-9/8/2026。我们检查了 12 个 subreddit、544 条 Twitter,没有进一步扫 Discord。
AINews 网站支持检索所有往期内容。提醒一下,AINews 现在是 Latent Space 的一个栏目。你可以自主选择开启或关闭邮件频率!
(以下摘要提炼了关键事实;我们建议不必深究作者署名相关的争论,因为 OpenAI 和作者们已经披露了足够多的细节,足以得出「OpenAI 的成果是真实的」这一结论,尽管过程仍存在一些争议。)
AI Twitter Recap
OpenAI 相关账号宣称一次由 AI 协助的工作产出了 Navier–Stokes 的成果,外界反应立刻分裂成三派,技术兴趣、怀疑态度、元层面戏剧。
推文集合里最具体的公开声明来自 Ethan Knight。他表示「Navier–Stokes 解答方案是约 10,000 个 agent 协作的结果」。他补充道,OpenAI 在过去一年里训练模型通过「多智能体强化学习(multi-agent RL)」进行协作,并认为困难问题可能通过「海量非结构化的并行 test-time compute(推理时计算)」,让模型自行决定如何组织协作来攻克@eknight。
多位旁观者把这理解为 OpenAI 在宣称一项 AI 生成的、涉及 Navier–Stokes 千禧年难题(特别是有限时间奇点 / blow-up)的证明。一段讽刺性改写把它描述为 OpenAI 称光滑流体可以「blow up 成奇点」,声称动用了「10,000 个 agent」和「88 小时」,同时明确指出数学界的承认仍是一个「小小的形式问题」@LearnOpenCV。
更广泛的评论把这件事视为对「前沿 AI 无法做严肃研究或写代码级技术工作」这一信念的潜在压力测试。Theo Jensen 称之为科学界「『AI 根本写不了代码』的破防时刻」(译注:英文「crash out」,网络用语,指情绪崩溃、破防)@theo。
Hrishikesh / hrishioa 把这条消息解读为「高算力体制」到来的证据,呼吁观察者「相应调整你的计划」@hrishioa。
这条消息还引发了零星的运营层面猜测。一位发帖者开玩笑地把看到 ChatGPT 延迟警告,与 OpenAI 可能将大规模算力重定向到 Navier–Stokes 这件事联系起来,但这纯粹是猜测,并非证据@teortaxesTex。
披露与前置背景
推文中已确证的事实
一则与 OpenAI 相关的声明流传,称一项 Navier–Stokes「解答方案」涉及约 10,000 个 agent 的协作@eknight。
同一来源称这些系统经过约一年的多智能体强化学习(multi-agent RL)训练@eknight。
所宣称的高层方法强调并行 test-time compute 和模型的自我组织,而不是单一长链的证明尝试@eknight。
公众读者将该声明理解为涉及 Navier–Stokes 存在性/奇点问题(千禧年难题之一),但具体的定理陈述与证明范围并未在推文集中给出@LearnOpenCV。
在讨论时点上,数学界的接受度显然悬而未决。即便是玩笑帖也强调正确性尚未经过领域验证@LearnOpenCV。
推文中尚未确立的事实
推文中没有出现定理陈述、预印本(preprint)、证明草稿、形式化验证产物、基准测试报告,或独立审稿人的评论。
「88 小时」这一被频繁重复的细节,在本推文集中仅出现在一篇讽刺帖中,并未出现在更直接的 OpenAI 相关声明里,因此不应仅凭此证据视为已被证实@LearnOpenCV。
人类与模型之间的具体角色分工未作说明。「约 10,000 个 agent 的协作」并不能告诉我们,是人类完成了任务分解、引理筛选、步骤校验,还是仅仅启动了基础设施@eknight。
「解答方案」含义模糊。在数学中,它可以指完整证明、证明策略、候选反例、形式化推导,或研究线索。推文并未对此加以澄清。
现有信息中并未说明该结果究竟针对的是 $(\mathbb{R}^3)$ 或环面上标准的三维不可压缩 Navier–Stokes 全局正则性问题,还是某个变体或辅助命题。
为何这种模糊性至关重要
Navier–Stokes 千禧年难题有一个非常具体的标准表述。如果有人声称「会发生」有限时间奇点,那将非常震撼,因为这等于在相关表述下对全局正则性给出否定回答。这类主张需要极其精确的审视。
在前沿模型的讨论中,「AI 解决了 X」往往压缩了多个层面。猜想生成、搜索、证明起草、证明检验、社区验证,全挤在一起。推文只给出了系统层面的描述,而非该数学结果的认识论地位。
推文所披露的技术细节
所披露的技术图景更像是一个研究系统架构,而非流体力学本身。
规模方面,约 10,000 个 agent 协同运作@eknight。
训练方法方面,约一年的多智能体强化学习(multi-agent RL)@eknight。
推理理念方面,海量非结构化并行 test-time compute,由 agent 自主决定如何分工和协作@eknight。
隐含的研究命题是,对于困难推理任务,扩展协调与搜索(推理时)的重要性,可能不亚于、甚至超过单纯扩展单体模型@eknight。
社会技术含义上,这是许多实验室一直在暗示的趋势的一次具体化表述。从「更大的单体模型」叙事转向 agent 集群、并行搜索,以及 test-time compute 扩展。
运营含义上,如果属实,这一结果表明各实验室愿意把大量推理算力投入到一次性科学目标上,而不仅仅是产品或基准测试。
技术层面的含义
一个 10,000 agent 的设置意味着以下基础设施必须相当完备,包括任务分解、智能体间通信、记忆/状态持久化、搜索树管理、奖励设计或代理评分、候选证明路径的聚合与选择。
「让它们自己决定如何协作」这句话暗示了一种部分涌现的协调策略,而非完全手写编排的流程@eknight。
如果这项工作真正触及了一个困难的数学问题,那么其关键新颖之处可能更多在于「带学习协作策略的分布式定理搜索」,而不是「LLM 写出一个证明」。
技术层面的缺失
未提及的内容包括,定理证明器集成、形式化验证、证明助手栈、符号代数系统、流体仿真组件、检索语料库、模型规模、算力预算、pass@k 风格指标、与单体基线的对照消融、错误率或证明检查成功率。
这种缺席至关重要。公开讨论的进度远远走在了所披露的技术基底之前。
事实 vs. 观点
作为事实陈述的内容
约 10,000 个 agent 参与其中@eknight。
OpenAI 已在多智能体 RL 上训练协作 agent 约一年@eknight。
该系统使用了大量并行的 test-time compute@eknight。
该结果在公开讨论中被作为 Navier–Stokes 解答/证明的主张来讨论@LearnOpenCV。
观点与解读
「解决困难问题最有效的方法之一」就是使用海量非结构化的并行 test-time compute 和自组织 agent。这是一种强有力的战略解读,仅凭推文中的证据尚未得到普遍证明@eknight。
「科学界正在经历他们『AI 根本写不了代码』的破防时刻」是关于社群心理状态的评论,并非可验证的评估@theo。
「我们确实处于高算力体制」是关于行业发展方向的一个宏观叙事@hrishioa。
「88 小时」、「领导力教训」以及「委派 10,000 个 AI agent」这类叙事属于讽刺内容,不应被当作纪实细节@LearnOpenCV。
声称 ChatGPT 变慢是由这项实验引起的说法,是一种缺乏支撑证据的猜测@teortaxesTex。
不同的视角
支持/看多的视角
最强的支持性视角是,这是一项新的扩展律(scaling law)的证据。不只是模型规模和训练算力,大规模并行、自组织的推理时协作,也能在前沿研究问题上解锁质变的新能力@eknight。
Theo 的反应捕捉了另一种乐观解读。如果 AI 能对顶级数学问题做出实质性贡献,那么对 AI 严肃技术工作能力的否定将更难维持@theo。
Hrishioa 的「高算力体制」框架暗示了实验室和初创公司的战略后果。低估推理时算力编排的人,可能在错误的前沿上进行规划@hrishioa。
怀疑/谨慎的视角
隐含的怀疑立场是数学层面的。在定理陈述、完整证明和专家评审出现之前,把这称为「解答方案」为时过早。那条玩笑帖本身就承认了这一点,强调全领域接受度仍悬而未决@LearnOpenCV。
另一个被怀疑的点是叙事压缩。「10,000 个 agent 解决了 Navier–Stokes」可能会掩盖有多少功劳归于人类的问题框定、筛选或验证。推文并未披露作者构成比例。
还存在可复现性方面的担忧。没有产物的情况下,独立研究者无法判断这一突破究竟是稳健的、经过挑选的,还是孤例。
中立/分析性视角
一种中立解读是,即便证明失败,这件事本身也值得关注。如果一个系统能在如此高规格的问题上生成数学意义上非平凡的候选路径,这本身就是一个有意义的能力里程碑。
另一种中立观点是把科学真伪与系统创新分开看待。即使该定理主张最终不成立,多智能体 RL + 并行 test-time compute 架构仍可能代表着 AI 研究方法论的一次重要进步。
这场讨论还揭示了人们衡量「能力」的标准正在发生转变。争论正在从基准分数转向大规模现实认知劳动的分解。
为何这在大背景下很重要
这件事处在前沿 AI 三重转变的交汇点上。
从静态模型到 agent 系统。所披露的核心要素不是一个类似聊天机器人的单一模型,而是一个庞大的协作 agent 群体@eknight。
从训练时扩展到推理时扩展。「非结构化并行 test-time compute」这一重点,与整个行业向「把算力花在解题时而非仅在预训练时」这一转向直接契合@eknight。
从基准刷分到领域主张。Navier–Stokes 在社会可读性上远超基准分数差值。任何触及千禧年难题的主张都会瞬间扩大受众范围,并提高认识论层面的风险。
为何 Navier–Stokes 具有象征意义
千禧年难题充当着「最严苛形式的智力工作」的文化速记。
这里的进展将意味着 AI 系统不仅仅是加速已有的工作流,而是进入那些正确性极其脆弱、声誉过滤器极为严苛的领域。
话虽如此,数学又格外严苛。不像许多产品任务,这里没有「大抵正确」的余地。这就是外部验证主导讨论的原因。
若该主张最终成立,意味着
为分布式定理搜索作为一种严肃的研究范式提供了有力证据。
给形式化方法工具链带来新压力,促使其吸纳模型生成的证明候选。
AI for math 领域的投资可能加速,尤其是围绕编排、验证器耦合和可扩展搜索。
在编码 agent 和办公自动化之外,对 test-time compute 和多智能体 RL 实用性进行一次更广泛的更新。
即便该主张最终未能完全成立,也意味着
即便如此,OpenAI 的内部战略方向也会被公之于众。大规模 agent 协作是一个核心能力领域。
人们的预期会改变,关于算力被花在哪里、各实验室会用什么样的演示来宣示前沿进展。
可能促使竞争者披露类似系统,或匆忙推出与之对标的「AI 做科学」主张。
关于署名、披露以及谁来发声背后的争论
讨论中还有一个次要线索。细节是否在以间接方式被泄露?谁有权披露?人们应该从片段中推断出多少?
一条推文说「Roon 看起来是会遵守 NDA 的人」,这指向围绕该事件的社会层面。一些观察者原本预期知名内部人士或邻近人物会保持沉默,结果细节反而是从别人那里拼凑出来的@jd_pressman。
Theo 的「『AI 根本写不了代码』破防时刻」帖子还起到了社会挑衅的作用,把批评者框定为「面对能力更新情绪化反应」,而非先去面对证明标准@theo。
关于一张「OpenAI 电影」图像以及猜测谁会出现的两条推文,并不直接涉及 Navier–Stokes 主张本身,但它们反映了一种平行倾向,即把 OpenAI 内部叙事映射到 Greg Brockman、Ilya Sutskever、Jared Kaplan、Dario Amodei、Paul Christiano 等具体个人身上,即便证据相当稀薄@willdepue, @jachiam0。在 Navier–Stokes 讨论的语境下,这种倾向之所以重要,是因为人们很快就会把技术主张人格化为署名归属和内部八卦问题。
玩笑帖和猜测帖展示了一个在前沿 AI 发布中熟悉的模式。官方细节稀缺,制造出一个真空,被 meme、看似泄露的片段、外推和过度宣称所填补@LearnOpenCV, @teortaxesTex。
为何署名/八卦问题在技术层面也重要
对数学主张而言,来源(provenance)不仅仅是八卦。它影响:谁框定了猜想,谁筛选了候选引理,证明是机器生成还是机器辅助,功劳归属应该是什么形态,专家对该产物会给予多少信任。
在 AI 研究中,「多智能体解决了 X」也会模糊对贡献的标准理解。如果上千个 agent 在并行搜索,那么证明的「作者」是谁?编排团队的角色是什么?究竟应该引用或复现什么?
当一项主张足够大、足以在论文或证明出现之前就改变公众信念时,NDA 和披露规范会变得尤为敏感。
其他新闻
Meta Muse 的发布与个人 agent 的安全架构
Meta 推出了 Muse,一款面向消费者的「个人 AI agent」,定位为常驻在线、可连接 App、可使用浏览器、以目标为导向,并通过 Meta 自家产品矩阵和集成实现强势分发@finkd, @alexandr_wang, @MetaNewsroom。产品细节被反复提及,包括持久化的隔离 Linux 虚拟机(VM)、浏览器使用、WhatsApp/App 接口,以及与 Gmail、Calendar、Outlook、Plaid、OpenTable、Docs、Spotify、Peloton 等服务的连接器,外加 Instagram、Messenger、Facebook 和 Marketplace 等 Meta 原生连接器@alexandr_wang。
安全架构是被最强力主打的差异化点。
Meta 团队表示,每个 Muse 运行在各自独立的安全 VM 中,操作由一个独立的 Sentinel 介入,密钥从不直接暴露给 agent,敏感操作需要审批,并设有最高 30 万美元的公开漏洞悬赏@shengjia_zhao, @alexandr_wang。另外,他们还明确了点商业基础设施方面的安排,包括通过 Stripe Link 完成支付,并附带 agentic 支付保护/退款保证,以及即将上线的 Shop Pay 集成@alexandr_wang。
来自从业者的早期反响相当正面,尤其在权限管理、密钥管理与消费级实用性上。@matthuang、@signulll 和 @lilyjclifford 的评论表明,Muse 可能是首批广受关注的、以「上下文与权限」而非「原始模型智商」为瓶颈的个人 agent 产品。Meta 还表示 Muse 第一天使用量超过内部预期的 10 倍@alexandr_wang。
模型与生态定位方面,Meta 的 Muse Spark 1.3 很快在 Cursor 等第三方工具中露出@cursor_ai,而在 arena 风格的基准测试中,Muse Spark 1.3 Max 在网页开发编码工作负载上被定位为具备价格/性能竞争力@arena。
OpenAI 的 Image 2.5 发布与 Astra 铺开
OpenAI 还发布了 ChatGPT Images 2.5,尽管它被部分抢了风头。该版本强调相比 Images 2.0 延迟降低多达 50%、更逼真、跨多次编辑的一致性更强、基于评论的局部修改、透明背景,以及一个新的 Sketch 工具用于引导式生成@OpenAI, @ChatGPT, @sama。
引入了两种 API 变体。GPT-Image-2.5 Flare 面向速度/质量,Sunburst 则面向更高精度、更细致的工作@reach_vb。Arena 结果声称在文生图、图像编辑和多图编辑排行榜上占据 #1 和 #2 位置,多图编辑上进步尤其显著@arena。集成迅速在 fal、Higgsfield、Manus 和 Hermes Agent 上落地@fal, @higgsfield, @ManusAI, @Teknium。
Astra 的可用性也大幅扩大。
OpenAI 表示 GPT-6 Astra 现在已在 Codex 和 ChatGPT Work 中完整上线,覆盖 Plus、Pro、Business 和 Enterprise 用户@OpenAI。社区演示展示了强大的实际 computer-use 表现。@theo 报告称 Astra 经过约 6 小时循环后在 macOS 上以 120 FPS 编译并运行了 Super Smash Bros. Melee,而 Vals 则报告称 Astra 在一个未发布的 computer-use 评测上几乎饱和,在不到 3 小时、没有专用 harness 的情况下搭出了一个 Minecraft 下界传送门@ValsAI。
Agent Harness、Post-Training 与推理基础设施
Harvey + Baseten 的 M&A 尽调工作,是最清晰的「模型-harness 协同优化」案例之一。
其递归语言模型(RLM, recursive language model)harness 使用一个根 agent 来搜索 data room,将文档审查委派给子 agent,并在最多 8000 万 tokens 的语料库上汇总发现。在合成 LAB Diligence 基准测试上,从标准工具循环切换到 RLM harness,平均 rubric 通过率从 23% 提升到 62%,跨多个模型@harvey, @nikogrupen。
harness 内的 post-training 与 harness 本身至少同等重要。
Harvey 报告称,在 GLM-5.2 上的自蒸馏 SFT 将通过率从 46% 提升到 60%,而在 Qwen3.5-122B-A10B 上的 GRPO 在留出 data room 上将通过率从 30% 提升到 63%,文档覆盖率从 62% 提升到 96%@harvey。与其他人的看法相呼应,更广泛的含义是,agent 基准测试越来越需要把编排与 post-training 视为模型系统的一部分,而非外部「胶水」。
LangChain/deepagents 发布了一些面向 harness 设计的「生活质量」原语,包括 subagent forking(把 supervisor 上下文传递给子 agent),以及抽象 OAuth/token/同意流程的托管连接,可同时支持 agent 自有身份与用户自有身份@colifran_, @hwchase17, @caspar_br。这表明围绕长时程 agent 工作负载的技术栈正在走向成熟。
推理与系统,稀疏注意力、Agentic Serving 与 Decode Megakernels
vLLM 在长上下文 serving 上的工作值得注意。
The