
25位菲尔兹奖得主联合声明反对AI企业把解决著名数学难题当作模型能力基准,认为这会伤害数学共同体。导火索是OpenAI宣称用88小时解决纳维-斯托克斯方程,但该证明未经同行评审,且与两位数学家的优先权争议叠加,引发集体表态。
数学共同体的忍耐阈值,在2026年9月被一次高调的模型发布彻底击穿。
25位菲尔兹奖得主罕见地站到同一阵线,用一份联合声明表达对AI企业解题方式的不满。签署者中既有1978年获奖的皮埃尔·德利涅,也有2026年刚刚获奖的邓煜,时间跨度接近半个世纪。这份声明经由陶哲轩的博客同步发出,虽然全文没有点名任何企业,但《经济学人》在报道中直接将其解读为对OpenAI做法的愤怒。
陶哲轩博客原文的措辞相当克制,却指向一个尖锐判断:把解决著名难题当作衡量模型能力的标尺,正在对数学这门学科和学术共同体造成实质性伤害。
要理解这场冲突,需要把时间拨回公告发布之前。
纽约大学的Tristan Buckmaster与供职于Anthropic的Levent Alpöge,在OpenAI官宣前一天公开了他们在受迫欧拉方程等关联问题上的成果,附带三篇论文草稿,合计245页。Buckmaster随后发表声明,称与OpenAI沟通后发现对方的解题路线与自己正在推进的方向高度重合。
按照OpenAI的说法,其内部模型动用了约1万个Agent,先用1000个Agent在简化版本上试跑50小时,再集中攻坚纳维-斯托克斯方程,总耗时88小时,消耗算力达到数百万美元量级。模型给出的结论是:存在一类初始完全静止的正常流体,在光滑外力作用下会于有限时间内速度升至无穷大,即所谓“爆破”现象。
但数学家关心的从来不只是结论。这份证明尚未经过同行评审,而克雷数学研究所的规则要求解题者先在同行评审期刊发表成果,再经过两年考察期,才有资格领取悬赏。
争议的核心落在署名与数据边界上。Buckmaster质疑OpenAI是否读取过用户数据,因为双方数月的工作记录都留在Codex中。他称OpenAI方面否认模型查看用户数据,却对训练数据来源避而不谈,并提出过一份由他执笔宣布解题、致谢OpenAI但Alpöge不得署名的合并方案。
牵头千禧年难题攻坚的Sébastien Bubeck在简报会上全盘否认,称研究员和Agent在对方公开发布前没有接触过任何相关工作,并公开短信记录证明自己曾提供“优先发表”选项。Sam Altman也出面为团队辩护。不过OpenAI官方博客留下一句耐人寻味的补充:无法完全排除用户使用产品所产生的去标识化数据曾帮助改进模型。
公开信真正的锋芒,不在于某一次发布的程序瑕疵,而在于它揭示了一种结构性错位。
数学史上的著名难题,历来扮演着“灯塔”角色。解决一道这样的问题,往往伴随新洞见与新方法的诞生,随后还要经历漫长消化——报告、讨论、简化,直到沉淀为研究生甚至本科生可以学习的教科书内容。有些思想要等几十年乃至几百年,才会成为全人类共用的工具。
公开信的核心论点正在于此:解题只是通往概念理解与洞见的工具,一旦把工具当成目标,工具就会反噬目标。以越来越快的速度批量生产“真/假”命题,可能摧毁数学赖以生长的沃土,而不是为思想注入生机。
这种担忧并非孤立事件。过去几个月,AI与数学的摩擦接连不断:5月,OpenAI内部模型给出的反例推翻了组合几何中悬置80年的Erdős单位距离猜想,验证论文由九位数学家联名完成;6月,《关于人工智能与数学的莱顿宣言》发布,获国际数学联盟正式背书,签名超过2600人;7月,Alpöge用Claude证伪了87年未解的雅可比猜想;8月,陶哲轩撰文判断AI可能让数学遭遇“自Gödel以来最大的危机”。
值得注意的是,公开信并未反对AI本身。它承认AI具备增强和加速真正数学研究的潜力,也承认数学职业需要适应变化。信中留下的一句话被广泛引用:这些变化最终是造福还是破坏,很大程度上取决于掌控新技术的人类如何决策。
在OpenAI与菲尔兹奖得主们围绕优先权和数据边界争执的同时,国内AI团队在数学推理方向走出了一条侧重工具化与教育落地的路径。
DeepSeek系列模型持续在形式化推理与竞赛级数学题上投入,其开源策略让研究者可以复现和检验推理链条,而非只看到一个封闭的结论。通义千问则与国内高校合作,将模型能力嵌入数学辅助教学与定理证明的验证环节,强调过程可追溯。智谱GLM、Kimi等团队也在长链条推理和符号计算结合上有所布局。
与海外争论的焦点不同,国内讨论更多集中在如何让AI成为数学研究的“脚手架”而非“替代者”——这恰好呼应了公开信中那句被反复引用的判断:工具的价值取决于使用工具的人如何设定目标。
数学家对新技术发难,历史上并不新鲜。苏格拉底曾抱怨文字让人懒得记忆,圆珠笔出现时有人担心书写失去感官冲击,电子计算器普及也曾吓到一批人。结果人们照样写字,数学家照样做研究,只是更快。
但这一次的指控中多了一种新的焦虑:连理解本身都可能被绕过。哥伦比亚大学Betsy Sparrow团队2011年的研究发现,搜索引擎普及后,人们遇到难题会先搜索而不是回忆。当AI能够直接给出证明结论,数学家是否会逐渐失去推导过程中那些真正孕育洞见的挣扎?
这或许才是25位菲尔兹奖得主真正想守护的东西。
声明反对AI企业将“解决著名数学难题”当作衡量模型能力的基准,认为这种做法对数学科学和学术共同体有害,呼吁关注概念理解与洞见,而非单纯追求解题速度。
尚未。该证明未经过同行评审,且克雷数学研究所要求解题者先在同行评审期刊发表成果并经过两年考察期,才有资格领取悬赏。
Buckmaster与Alpöge称他们在OpenAI官宣前一天已公开相关成果,并质疑OpenAI是否读取了留在Codex中的工作记录。OpenAI否认接触过对方未公开的工作,但承认无法完全排除去标识化数据曾帮助改进模型。
不是。公开信承认AI有增强和加速数学研究的潜力,反对的是把解题本身当作目标,以及由此带来的署名、抄袭和传承断裂问题。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。
编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com
© 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

DeepMind 的 Agent 实验揭示了一个尴尬现实:当数学难题变成跑分工具,AI 大厂竞相宣布「攻克名题」的背后,数学本身得到了什么?

Anthropic、OpenAI、Google DeepMind 与 xAI 罕见地在「放缓大模型发展」上达成公开共识。但细读事故报告会发现,被包装成「力量失控」的事件,更像是一次训练流程缺陷。本文拆解安全叙事与 IPO 竞争逻辑之间的张力。

当智能体从偶尔调用走向持续在线,算力消耗呈现结构性膨胀。本文从IDC增长数据出发,分析万亿参数模型对计算体系的连锁影响,以及芯片、存算、互连、系统协同面临的现实考验。
최신 SEO·GEO 정보를 받아보세요.
개인정보를 존중합니다. 언제든 구독을 취소할 수 있습니다.