88小时,1万个智能体攻一道数学题
当地时间9月8日,OpenAI发布声明称,其一个尚未公开、能力在GPT-6 Astra之上的下一代模型,组织约1万个AI智能体协作,用88小时给出了纳维-斯托克斯方程存在性与光滑性问题的证明,并同步公开了166页论文和可在Lean定理证明器中运行的形式化验证代码。科技日报、环球网等媒体随后跟进报道。这道题是克雷数学研究所列出的七大千禧年难题之一,悬赏100万美元,自2000年公布以来仅有一题被解答。
OpenAI表示,如果研究结果获得证实,将不会申领这笔奖金。按照克雷数学研究所的规则,解答须发表于经过同行评审的期刊,并在数学界广泛接受满两年后,研究所才会召集委员会审议。所长马丁·布瑞德森对媒体表示,评估过程刻意不求快速,将确保审查足够严谨。
解题过程与成本:智能体流水线式作战
根据OpenAI披露的时间线,内部模型从8月28日起开始训练,首批智能体启动约88小时后,系统在9月5日得到解法,随后由GPT-6 Astra用17小时完成Lean形式化。证明思路并未直接证明无外力情形解必然光滑,而是选择了克雷题目的其中两个方向:构造有限且处处光滑的外力,使光滑解无法维持到所有时间。
真正的关键不只在模型本身,也在组织方式。智能体被分成多个小组,各自拿到不同题面,可以读取缓存互联网内容、运行代码并在组内交流;近百个智能体先用约50小时处理无外力的欧拉方程并得到有限时间奇点,随后算力转向纳维-斯托克斯问题,由Codex汇总思路并交叉分发。OpenAI研究负责人对媒体表示,算力成本确实达到数百万美元量级,研究人员布贝克称这约为公司以往取得数学研究成果所花费成本的1000倍。
成果归属起争议,双方各执一词
争议几乎与声明同时出现。消息公布数小时前,纽约大学数学教授巴克马斯特与供职于Anthropic的研究员阿尔波格刚刚公布了各自借助AI在相近方向取得的成果。巴克马斯特发布声明称,OpenAI是在其研究进展传开后才开始着手,并且采用了他们花费数月发展出的同一特殊路径;他还指控OpenAI方面在沟通中提出过有争议的署名安排。
OpenAI对此坚决否认,称相关指控虚假且具煽动性,研究人员与智能体均未接触对方成果,也未为解题访问特定用户数据,并强调双方在欧拉问题的外力设定上并不相同。不过OpenAI随后在社交平台承认,虽然可能性不大,但不能完全排除对方使用其产品产生的去标识化数据曾以某种方式参与模型改进。截至发稿,双方各执一词,事实层面尚无定论,结论仍有待数学界独立检验。华裔数学家陶哲轩9日在评论中提醒:好问题将要比好答案更稀缺。
企业视角:可验证的产出才是可信的产出
抛开归属争议,这件事对企业侧有两个值得记录的信号。其一,智能体的价值正在从"单点问答"转向"规模化协作",万级智能体分工、汇总、交叉校验的作业方式,已经接近一条自动化研究流水线。其二,OpenAI把Lean形式化验证作为交付物的一部分,等于承认了一个常识:AI给出的结论,需要机器可核验的凭据才有说服力。
这两点放到企业内容的AI检索场景同样成立。大模型在生成答案时越来越倾向引用可核验、有出处的信息,官网上的数据如果来源模糊、无法交叉验证,被采信的难度会持续上升。极欧互联在GEO优化项目中的做法与此一致:先把企业的事实层整理成可溯源、结构清晰的内容,再谈被AI引擎引用。
趋势研判:AI进军前沿科学才刚刚开始
OpenAI将此次成果称为通用人工智能进入前沿科学发现的信号。如果证明通过数学界检验,AI在基础科学领域的角色将被重新定义;即使存在争议,万级智能体协作、形式化验证、数百万美元算力投入的工程路径,也已经摆在所有研究机构面前。可以预期的是,围绕AI产出的署名规范、数据使用边界和独立验证流程,会随着此类事件增多而逐步成型,谁先建立可信的验证与披露机制,谁就更容易在AI检索时代赢得信任。
信息来源
- 科技日报,《AI智能体八十八小时解出千禧年难题之一,引起"抢发"数学家成果争议》,2026-09-10,https://www.stdaily.com/web/gdxw/2026-09/10/content_578175.html
- 环球网科技(今日头条转载),《OpenAI攻克数学难题引发学术争议,纽约大学教授指控其利用资源"截胡"研究成果》,2026-09-09,https://www.toutiao.com/article/7683366582281765403

