AI狂解数学难题,25位菲尔兹奖得主坐不住了

2026-09-12 21:25:11 · chineseheadlinenews.com · 来源: 创业邦

AI开始接连攻克人类几十年没有解决的数学难题,数学界却没有欢呼。

9月11日,陶哲轩、邓煜等25位菲尔兹奖得主联合署名发表公开信《人工智能在数学中的严重错位》(A Severe Misalignment of AI in Mathematics),质疑AI公司把“解决著名数学难题”当作衡量模型能力的基准。

签名名单横跨近半个世纪的菲尔兹奖史,从1978年获奖的皮埃尔·德利涅一直排到2026年刚刚获奖的邓煜。

而在9月8日,OpenAI刚刚宣布其内部AI系统以约一万个并行智能体、88小时完成了纳维-斯托克斯方程存在性与光滑性问题的证明,同步公开166页论文及Lean验证代码。

OpenAI官宣的前一天,纽约大学数学家Tristan Buckmaster与供职于Anthropic的数学家Levent Alp?ge刚刚发表了同一问题上的突破性成果,外加三篇论文草稿,合计245页。

Buckmaster在随后一份措辞激烈的声明中表示,他与OpenAI沟通后发现,对方的解题思路与他们正在走的路线“几乎一模一样”。在学术传统中,得知他人未发表的研究方向后抢跑,是最犯忌讳的事之一。更令他警觉的是,他数月的工作记录都留在OpenAI的Codex编程模型中。

两天后,X平台爆料称OpenAI已接近完成对第二道千禧年难题霍奇猜想的验证,OpenAI与Anthropic据传正就第三道难题BSD猜想展开暗中竞速。

如果这些进展最终得到确认,那么数学界面对的已经不是“AI偶尔解出一道难题”,而是一种新的科研生产方式:AI公司开始用大规模算力、智能体和模型协作,持续向过去由数学家长期攻坚的问题发起冲击。

对AI公司来说,数学难题是理想的能力测试:题目足够难,答案相对明确,推理过程可以验证,而且解决千禧年难题这样的成果天然具有传播性。

但对数学家来说,证明一道题只是研究的一部分。一个问题为什么值得研究,过程中有没有产生新的概念和方法,以及其他研究者能否理解并继续推进,同样决定一项数学工作的价值。

于是,一场由一道数学题引发的争议,开始指向AI进入科学研究后更现实的问题:当机器越来越擅长给出答案,谁来定义什么样的答案值得被称为科学进步?

01

AI解题的“能力基准”之争

数学天然适合成为AI能力测试。一道数学题通常有明确的问题边界和相对清晰的正确答案,模型能否完成长链条推理、处理复杂的中间步骤,也比较容易验证。

越难的问题,越能证明模型能力。

如果一个模型能够解决过去几十年没有解决的问题,外界很容易理解这件事的意义。尤其是千禧年难题,本身就具有极高的知名度。

OpenAI此次选择纳维-斯托克斯问题,就是典型案例。这道题从2000年起被列入七大千禧年难题,涉及流体运动的数学描述。OpenAI此次公布166页论文和Lean形式化验证代码,并强调约1万个AI智能体协同工作、88小时完成证明。

对于AI公司而言,这是一种非常直观的能力展示:模型开始处理过去只有少数顶尖数学家能够处理的问题。

但数学界关注的指标不同。25位菲尔兹奖得主在公开信中指出,数学研究的重要价值并不只是得到最终证明。研究过程中产生的新概念、新方法、新工具,以及成果能否被其他数学家理解、使用和继续发展,同样重要。

AI公司更容易量化“解决了什么问题”,数学家更关心“解决之后,人类多知道了什么”。

9月初发生在OpenAI与数学家Tristan Buckmaster之间的争议,又让这种分歧变得更加具体。

OpenAI发布纳维-斯托克斯相关成果前,Buckmaster与Anthropic数学家Levent Alp?ge刚刚公开了围绕相关问题取得的研究进展。Buckmaster随后质疑OpenAI的研究路线与自己的未发表工作高度接近,并担心自己的研究记录曾存在于OpenAI的Codex中。

OpenAI随后回应称,Buckmaster此前两个月的Codex提示词不可能影响此次研究,同时表示无法完全排除匿名化用户数据对模型训练产生间接影响的可能。

双方对于具体研究成果之间是否存在关系仍有不同说法,但这场争议暴露出另一个问题:AI公司的研发速度,开始进入科学研究原有的规则体系。

数学研究强调公开交流、独立发现和成果归属,而AI公司追求的是更快的模型迭代和更强的能力证明,两套体系开始发生碰撞。

02

从“证明稀缺”到“证明丰裕”

陶哲轩对这场变局的思考,远早于联合声明的发表。

早在2026年3月与知名播客主持人Dwarkesh Patel的深度对话中,他就系统阐述了自己的判断:人工智能在广度上出类拔萃,人类在深度上出类拔萃。两者非常互补。AI已将创意生成的成本压至近乎为零,但验证、判断与叙事说服,依然是不可被自动化的人类核心能力。

近期,陶哲轩参与了Big Think一场深度访谈(访谈内容戳→OpenAI的“超级突破”遭数学家公开质疑了,陶哲轩此前警告:AI越来越会做数学,人类却未必更懂科学)。在访谈中,他把AI带来的变化概括为数学正在从“proof scarcity(证明稀缺)”走向“proof abundance(证明丰裕)”。几千年来,数学一直活在证明稀缺的年代——推导证明举步维艰,每一个证明都弥足珍贵。而现在,AI生成证明的速度已经远超人类消化能力,数学正在被自己的产出撑爆。

他提出了一个更令人忧虑的命题:那些能够产生新方法、新洞见的开放问题,是一种可能被快速消耗的“不可再生资源”。一旦某个有价值的研究方向被公开,大量AI算力和智能体可能迅速涌入,抢先推进甚至解决问题,这可能迫使研究者不再公开有前景的研究方向,从而“逆转数百年来开放科学的传统”。

如果说联合声明指向的是数学知识体系的危机,陶哲轩更深的忧虑则指向了人。

他多次警告,科研体系正处在“有些危险的节点”:AI正在以越来越快的速度制造科学产出,但代价可能是损害下一代科学家的培养。

研究生进入一个领域后,导师通常不会让其直接挑战最困难的开放问题,而是先安排一些难度相对适中、可以获得科研经验和职业认可的项目。现在,这类训练问题正好进入AI快速扩张的能力范围。陶哲轩说,如果用AI替代研究生,AI可以生成研究生水平的论文,但我们不会因此得到下一代学生。

“做数学像徒步去远方,AI则是架直升机,直接把人们空投到答案附近。但数学的价值不只是到终点,慢速做事也有价值。”一个科学家花几个小时在纸上算,亲手做实验,实际调试模拟,他们常常学到很多超出得到答案的额外洞察——发现新现象、看到联系、看到与先前研究的相似性,并与其他交流发现,这些可能比最终的证明更加重要。

这并非杞人忧天。2026年菲尔兹奖得主雅各布·齐默曼在获奖当天宣布加入OpenAI,理由是“两年之内,AI做数学会比数学家更好”。2026年的菲尔兹奖被学界戏称为“人类的最后一届菲尔兹奖”。

但邓煜的态度更为审慎。这位2026年菲尔兹奖得主坦言,AI已能帮助数学证明,但“不能替代独立思考”。他透露,GPT曾帮助他解决一个连续几天未能突破的数学特例,但该证明无法推广到一般情形,未写入最终论文。他强调,对刚进入科研的学生而言,“不能因为AI给出了一段看似完整的论证,就跳过独立判断和严格核验这些必要的步骤”。

03

当答案不再稀缺

过去几年,AI模型的能力竞争有很多指标:考试成绩、代码能力、数学推理、知识问答。随着模型能力提升,AI公司开始寻找更难的测试,解决世界级数学难题就是其中之一。

但如果AI可以越来越快地解决这些问题,“解出了多少题”作为Benchmark的价值也会下降。科学研究还有一些很难被量化的能力:一个问题为什么值得研究?一个证明中最有价值的部分是什么?一个结果能不能产生新的理论?能不能推广到其他问题?能不能让其他研究者继续使用?

这些问题无法简单转换成一个分数。

陶哲轩此前谈到AI与数学时,反复强调过“广度”和“深度”的差异。AI可以扩大搜索范围,把大量过去需要人工完成的计算和尝试压缩到很短时间里;但当答案变得越来越便宜,选择什么问题、理解什么答案,反而变得更加重要。

这可能也是AI进入科学研究后,模型评价标准需要面对的变化。

如果今天比的是“谁能回答得更好”,明天比的可能是“谁能完成更复杂的研究任务”。再往后,真正困难的问题可能变成:AI能不能帮助人类发现此前不知道、而且值得被发现的东西?

数学可能只是最早出现这个问题的领域。随着AI进入物理、化学、生物等研究,科学家面对的也会是同一个问题:机器可以生成更多假设、搜索更多路径、运行更多模拟,但结果数量增加,并不等于科学知识等比例增加。

人类仍然需要判断什么值得研究,哪个结果可信,以及一个结果为什么重要。

25位菲尔兹奖得主这封公开信,他们并没有要求AI退出数学,也没有否认AI能够提高研究效率。他们提醒AI公司的,是另一件事:“解决难题”可以证明模型很强,但不能单独证明它理解了数学,更不能代表一项科学研究创造了多少新的知识。

模型可以用“答对了多少题”衡量,科学研究却很难用“解决了多少问题”衡量。

当AI从回答问题走向参与研究,AI公司的下一场竞争,可能也不再只是让模型解决更难的问题,而是让模型找到那些人类此前不知道、却值得研究的问题。

这可能才是“AI做数学”真正难的下一关。


    24小时新闻排行榜更多>>
  1. 印度对华摊牌:要求中方让出印度市场
  2. 柯克遇刺纪念活动现场,打起来了
  3. 习近平反腐十四年 越反越腐出烂招?
  4. CEO恋爱时挥金如土,分手后闹上法庭
  5. 美移民执法连3月创新高 ICE夏季转向低调街头逮捕
  6. 儿搭机踢椅背 父动手护短 中国新移民全家被美遣返
  7. Google Earth之后,高德为什么还要再造一个Earth?
  8. “肝癌大户”被揪出,是烟酒的11倍
  9. 携程被罚51亿后再曝大数据杀熟
  10. 关系大了!青藏高原暖化 竟触发加州创纪录豪雨
  11. 干部将辖区内女子推入厕强奸 公安机关多次拒立案
  12. 中国首富要换了
  13. OpenAI关停史上最快模型
  14. 央视曝光,致癌物超标85倍
  15. 谭咏麟演唱会星光熠熠,圈中好友倾巢而出
  16. 人算不如天算 死神名单真的存在?
  17. 习近平出席金砖国家第十八次会晤第一阶段会议
  18. 绝密文件显示:“9·11”发生前,就有人警告过
  19. Fed传声筒暗示升息来了 美银德银预测今年调高3码
  20. 金砖国家吁中东“最大程度克制”
  21. 李修贤又揭周星驰老底
  22. 日本人来华签证费上涨7倍
  23. 小扮站在凌晨两点的北京簋街:我恨自己的国家
  24. 美国移民执法连3月创新高
  25. 访华后川普盟友说 美国低估了中国科技的先进
  26. 21岁面临“二选一”:新加坡籍还是中国籍?
  27. 谁才是全球最招人嫌的游客?
  28. 陶哲轩、邓煜等25位菲尔兹奖得主联合警告
  29. 25岁前保险经纪涉售假保单,被控诈欺
  30. 为什么美国年轻人开始“叛国”,成了“中吹”?
  31. 普京:西方为重夺主导地位“不择手段”
  32. 这些粗粮会让血糖飙升
  33. CIA解密911内幕 3年前曾“示警” 遭2任总统无视
  34. 越南人为什么拼命学英语?
  35. 刘翔“买断风波”落幕,算不算体面收场?
  36. 尹锡悦,又一案判了
  37. 习近平:反对侵犯别国主权
  38. 川普:我能解决马岛问题
  39. 卡尼下周迎来最大考验
  40. Altman放话:OpenAI今年不会IPO
  41. 地下铜矿钻井岩芯中发现恐龙化石
  42. 范斯忧心忡忡,密电曝光
  43. 莫迪与习近平举行双边峰会
  44. 金砖峰会讲话 习近平:反对侵犯别国主权 干涉内政
  45. 国企党员因争议言论被判 自曝与公安、统战等部门合作
  46. 对付北京,“这国”祭出最高30年监禁
  47. 中方据报告知美方若有新对台军售将取消川习会
  48. 高盛最新判断:盈利增长才是牛市关键
  49. 饶毅晒图:盖章的与不盖章的
  50. 法拉奇不到24小时吸金7200万英镑
  51. 美国宣布:史上最大环孢子疫情结束
  52. 领克回应900起火自燃:系充电宝自燃
  53. 伊朗和阿曼将通报霍尔木兹通航磋商结果
  54. 伊朗、伊拉克外长通话
  55. 加油时一个举动,导致终身伤残
  56. 48岁“毛孩”于震寰近况曝光
  57. 乌官员:10月举行新一轮乌美俄三方谈判
  58. 每天坚持踮脚,有这8个好处
  59. 报告指美国会赴大陆与台湾访问都在减少 交流断层
  60. 全球首见:成年暴龙4巨大脚印出土