网易首页 > 网易号 > 正文 申请入驻

2026,AI给数学家带来危机

0
分享至

2026年,数学遭遇密集"AI攻城"。

7月20日,Anthoropic的一名员工Levent Alpöge在X.com上说,自己在看世界杯时,顺手用Fable 5找出了雅可比猜想的一个反例,在X上引起轩然大波,因为这是数学界的顶级“悬案”之一,人们用了87年试图证明它的正确性;华人数学家张益唐当年的博士论文题目正是与此有关,而论文的不顺又导致他后来多年以打杂为生。

Anthoropic这个非正式的数学高光时刻,已经比对手晚得多。再往前推两个月,OpenAI和谷歌几乎是当面对决

5月20日,OpenAI 宣布:其内部一个通用推理模型,自主推翻了匈牙利传奇数学家保罗·埃尔德什(Paul Erdős)提出的"单位距离猜想"。这个问题已困扰了数学家整整80年。菲尔兹奖得主蒂莫西·高尔斯(Timothy Gowers)直言不讳地评价:“此前没有任何AI生成的证明能接近这个水准。”

仅仅一天后,Google的DeepMind 以更大的规模还击。

他们设计的数学模型AlphaProof Nexus,自主解决了9道公开的Erdős难题,其中2道已经悬而未决长达56年。此外,它还解决了另外一些问题,每个问题的推理成本也低到仅为几百美元。


DeepMind高管Pushmeet Kohli宣布AlphaProof Nexus解决了数个问题丨X.com

三家公司的成果,在数学界和大众舆论中都引起了轰动。

能力飞跃

要理解今年数学界的震撼程度,可以回看这条清晰的加速曲线。

2024年7月,DeepMind的AlphaProof在国际数学奥林匹克竞赛(IMO)中解出6道题中的3道非几何题,达到银牌水平。这是AI首次在IMO中获得奖牌级表现。注意,此时它解出的问题都有答案,不是未知、开放性的。

2025年10月,OpenAI曾声称GPT-5解决了10道Erdős难题,但这一说法在几小时内就被公开驳斥:GPT-5并非原创求解,而是做了"超级文献检索",找到了此前罕为人知的已发表论文。

2025年年末,DeepMind部署了智能体Aletheia。在Erdős问题数据库中,Aletheia挑选了700道进行尝试;它正确解决了13个问题,其中4道是新解答,另外9道又是“超级文献检索”成功了。

而2026年5月至今的这三次突破,有了本质性不同:

第一,问题份量重。 Aletheia的研究者自己就承认,去年所解决的4道 Erdős 难题,大多冷门,有些可能从来没有专家认真尝试过。但此次OpenAI 所推翻的“单位距离猜想”,核心、知名,哪怕有Erdős本人为它悬赏却仍长期悬而未决,难度和地位都得到公认。

Anthoropic Fable 5找出反例的雅可比猜想,被美国数学家、菲尔兹奖得主斯蒂芬·斯梅尔(Steve Smale)列入“18个21世纪的世纪数学难题”。虽然这次AI只是找到了三维空间中的一个反例、二维中猜想是否为真尚不得而知,但仍因问题难度大,而被数位数学家认为是AI的重要突破。

第二,更自主。之前AI解决数学问题是"半自主"的:AI生成候选方案,然后需要数学家人工筛选、修正细微错误。而OpenAI 5月的突破,是模型完全自主地生成了整个证明。更进一步地,谷歌的AlphaProof Nexus不再需要数学家给它做质检了。它利用了一种叫Lean的形式语言,自主完成了正确性检验。

Fable 5的工作细节,现在我们还不得而知。

轰动新闻,离不开精心“设计”

OpenAI所解决的那个问题是这样的:在一个平面上放 n 个点,那么距离恰好是1的点,最多能有多少对?数学家Erdős在1946年猜测,正方形网格的排列方式是最优解。

不管你会不会解这道问题,但我相信,你很容易看懂它。这也正是OpenAI新闻成功引发轰动的关键点之一。


“OpenAI的数学团队里,有很了解数学研究的专业人士。这个团队显然是花了大量的时间,从那些尚未被解答的数学问题中,挑选哪个可能做得出来。从被挑选过的问题中,又着重精选几个最有可能出成果的、简单到大众也能听懂、数学家又要足够关注的问题”,北京大学国际数学中心副教授李欣意这样分析。

“甚至他们要考虑到,证明也不能冗长,不能让数学家用上半年才能复核完毕。”

Anthoropic Fable 5所提出的雅可比猜想反例,更是简洁到只有寥寥几行式子,很容易就被其他数学研究者验证。


Levent最初的那条推文丨x.com

是的,研究者们必须把“人类友好”考虑进去。

AI现在还不能抛开人类

当AI使用大语言模型写出一些“看起来很有道理”的推理的时候,它到底有没有犯错,是很难由它自己来确证的。

OpenAI使用的是一个通用推理模型。它接收到问题后,用自然语言(即人类能读懂的语言)生成了一条非常长的思维链,每个子Agent做一部分短小的自然语言论证、一环套一环,最后得出一个结果。

但自然语言推理有一个天然的弱点:模型可能在推理链的某一步犯小错,最终酿成大错。所以OpenAI请来了9位顶级数学家对证明进行人工审查。这些数学家不仅验证了正确性,还大幅改进了原始证明,使之更简洁、更通用。Erdős问题数据库的维护者托马斯·布鲁姆评论道:"人类在讨论、消化、改进这个证明以及探索其后果方面,仍然扮演着关键角色。"

DeepMind的AlphaProof Nexus在推理过程中,靠Lean语言暂时摆脱了“人”证明它对不对;人类只最后确认结果的数学意义。

· 大语言模型会用 Lean 的形式化语言生成证明步骤;

· Lean编译器检查每一步是否成立;如果某一步不通过,Lean 返回错误信息,模型据此修正;

· 循环往复,直到成功。

全部用Lean去验证这件事情,看起来很美妙,但还远远没有到完全能够实操的程度。简单说就是:Lean语言严格而冗长,人类很难直接写或读懂,需要“翻译”,但“翻译现有数学定理”这一基础建设,也还差得很远。

AI的数学能力高于人类吗?

先说结论:AI目前并不比人类更聪明。它只是没有学科壁垒、没有权威偏见,然后“大力出奇迹”。

AI证明了Erdős是错的、雅可比猜想有反例,而不是像大多数人那样,面对传奇数学家的一个古早猜想,沿着心理惯性,试图证明他是对的。它又比那些试图寻找反例的人,更有耐心反复尝试。

AI是个“通才”,这同样令人类自叹弗如。5月份OpenAI解决的单位距离问题属于几何领域,成功的关键是,它从代数领域的数论中引入了一个看似无关的工具。要知道,现代数学高度分工,研究组合几何的数学家通常不会深入探究数论,反之亦然。这两个领域之间的距离,就像让一个心脏外科医生去想到用免疫学的方法治病。

不过,AI现在缺乏在新方向上的洞察和探索能力。李欣意做了一个这样的比喻:

“如果人类的数学知识可以比喻成一个有凹有凸的多边形,外部是未知部分,那么一流的数学家可能在一个尖角上把边界拓展到远处;像希尔伯特这样的伟大数学家,甚至在好几个方向都走得很远;而广大的数学工作者大多数时候做的事情,是把凹进去的部分补齐——数学上叫做‘取凸包’。

“现阶段‘大新闻’里的的数学AI,也不过是把知识变成知识的凸包,而不是在未知方向上探索得更远。”


黄色的部分,是AI的“补齐”短板

假如有朝一日, AI 掌握了往外走的能力,那可能确实就真的是全面超越了人类。

数学家预见到重重危机

2026年6月2日,来自15所大学的16位研究者发布了《莱顿人工智能与数学宣言》。这份宣言获得了国际数学联盟(IMU)的正式支持,陶哲轩、彼得·舒尔茨等知名数学家也公开签署。

宣言并不反对使用AI,也鼓励数学家了解新兴技术。它担心的是,在用AI更快、更多地生成成果的过程中,数学界一些基本价值观可能被破坏

最直接的问题是,AI能够快速生成大量“看起来正确”的证明,其中却可能藏着很难发现的错误。AI“完成”一个证明只需要几小时;认真审查它,却要花几周甚至更长。有能力审稿的数学家极其有限,AI成果井喷会导致同行评议体系“消化不良”;如果大量的AI推理直接以预印本甚至新闻稿的形式发表,则是严重的误导,并挤占了那些真正有价值的发现的空间。

这个担忧甚至马上被验证了。就在几天以前,OpenAI在发布GPT 5.6 Sol的关头,发布新闻稿,宣布解决了一个尘封50年的数学问题。但这个成果并没有得到外部数学专家的确认。


OpenAI也没有说明,在“智能体解答问题”和“最终产出3页结果”之间,还有多少人类劳动丨OpenAI

另一个问题是成果归属。数学AI建立在大量的前人研究成果之上,但在输出时,往往无法为贡献者合理署名,这对数学家不公平。部分训练数据还涉及未经许可使用论文和数据库,由此产生新的版权争议。以及,如果数学家协同AI产生新的数学,那么这一成果究竟是属于人类还是AI?

《宣言》还提出了一个更隐蔽的威胁:科技公司可能开始影响数学界的导向。AI公司倾向于搞那些“容易做”的问题,而非“有深远意义”。在大学预算紧张的背景下,这可能改变激励机制,变相鼓励研究人员与科技公司进行不对等的合作。如果不加以控制,可能破坏现有的招聘、资助和认可机制,威胁研究人员的自主性,甚至影响数学研究本身的范围和深度。

Guokr

数学的价值不只是得到更多答案。它还包括理解答案为何成立,判断哪些问题重要,以及从旧知识中发现新的研究方向。这些能力由数学共同体经过长期讨论、争论和传承形成,很难用“解出了多少道题”来衡量。

因此,《莱顿人工智能与数学宣言》要求研究者公开AI和计算资源的使用情况,坚持同行评审,由人类作者承担正确性和引用责任,并建设独立于商业公司的公共计算设施。

数学家想守住的,并不只是自己的工作。他们还想守住决定“什么数学值得做”的权利。

感谢北京大学国际数学中心李欣意副教授对本文的支持

参考文献

1. [1] Anthony Ha. OpenAI’s ‘embarrassing’ math. TechCrunch,2025年10月19日。https://techcrunch.com/2025/10/19/openais-embarrassing-math/

2. [2] Matthias Bastian. Leading OpenAI researcher announced a GPT-5 math breakthrough that never happened. The Decoder,2025年10月18日。https://the-decoder.com/leading-openai-researcher-announced-a-gpt-5-math-breakthrough-that-never-happened/

3. [3] Tony Feng 等. Semi-Autonomous Mathematics Discovery with Gemini: A Case Study on the Erdős Problems. arXiv:2601.22401v2。https://arxiv.org/html/2601.22401v2

4. [4] Tony Feng 等. Towards Autonomous Mathematics Research. arXiv:2602.10177v3。https://arxiv.org/html/2602.10177v3

5. [5] Rubin Pillay. The Aletheia Moment: Why Dismissing AI Reveals Fundamental Misunderstanding. Substack,2026年2月17日。https://rubinpillay.substack.com/p/the-aletheia-moment-why-dismissing

6. [6] Noga Alon、Thomas F. Bloom、W. T. Gowers 等. Remarks on the disproof of the unit distance conjecture. arXiv:2605.20695v1。https://arxiv.org/html/2605.20695v1

作者:Luna

题图:Sally Caulwell

文内未注明来源的图片为AI生成

马上预约

果壳直播~夏季护肤问题全解答

夏天出油脱妆、晒到出斑泛红敏感,这些崩溃我都懂!7月23日,我们拉上果壳护肤“老师傅”——美丽也是技术活主编,死磕配方,专治各种不服。想安心度夏?点击预约,教你精准护肤,还有成分党超爱的护肤品,价格香速来抢!


点个“小爱心”吧


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
买罗德里的最大问题,不是薪资,不是健康,而是弗洛伦蒂诺的脸面

买罗德里的最大问题,不是薪资,不是健康,而是弗洛伦蒂诺的脸面

穆里尼奥主义者
2026-07-22 15:55:23
碳酸饮料卖不动,10万+评论区炸出人间真实

碳酸饮料卖不动,10万+评论区炸出人间真实

蓝鲸新闻
2026-07-22 10:57:29
时代落幕?曝39岁梅西告知队友:世界杯决赛是他在阿根廷队最后1战

时代落幕?曝39岁梅西告知队友:世界杯决赛是他在阿根廷队最后1战

我爱英超
2026-07-21 16:06:28
再见,皇马!“双子星”将携手离队!穆里尼奥钦点“王牌”中卫

再见,皇马!“双子星”将携手离队!穆里尼奥钦点“王牌”中卫

头狼追球
2026-07-22 15:37:03
外资撤离印度越南?美媒大胆预言:中国西部将成新世界工厂

外资撤离印度越南?美媒大胆预言:中国西部将成新世界工厂

田螺姑娘说历史
2026-07-22 13:00:01
CBA最新消息!辽宁旧将加盟北京首钢,青岛男篮签约超级外援

CBA最新消息!辽宁旧将加盟北京首钢,青岛男篮签约超级外援

体坛瞎白话
2026-07-22 10:31:57
全球文明研究院今天成立

全球文明研究院今天成立

界面新闻
2026-07-22 09:57:12
闹大了!韩红黑料越扒越狠,央视表态后,网友怒了:开除军籍党籍

闹大了!韩红黑料越扒越狠,央视表态后,网友怒了:开除军籍党籍

曹莽看世界
2026-07-20 21:01:40
中菲冲突第2天!菲律宾增兵,美国发声力挺,日本发现大事不妙

中菲冲突第2天!菲律宾增兵,美国发声力挺,日本发现大事不妙

影孖看世界
2026-07-21 16:10:23
里奇-保罗:各队无需再做任何事打动詹姆斯,所有信息都已传达

里奇-保罗:各队无需再做任何事打动詹姆斯,所有信息都已传达

懂球帝
2026-07-22 08:10:12
威少要告别NBA?国王不希望他回归 至今无任何球队开出正式合同

威少要告别NBA?国王不希望他回归 至今无任何球队开出正式合同

醉卧浮生
2026-07-22 08:27:13
后续!广东1岁男童玩水被冲走,母亲跪地不会游泳,外公怒打女儿

后续!广东1岁男童玩水被冲走,母亲跪地不会游泳,外公怒打女儿

追踪之点
2026-07-21 19:17:18
英国变天,新首相刚上台就掀桌,直接废除前任计划,对华态度曝光

英国变天,新首相刚上台就掀桌,直接废除前任计划,对华态度曝光

晰知
2026-07-22 03:41:18
四款AI徒手画蒙娜丽莎:GPT-5.6一次都没调色,Grok平均每幅99步

四款AI徒手画蒙娜丽莎:GPT-5.6一次都没调色,Grok平均每幅99步

碳基打工人
2026-07-22 05:38:00
西方最怕的新疆人出现了:会英语,还长得像耶稣

西方最怕的新疆人出现了:会英语,还长得像耶稣

公子故事会
2026-06-25 18:07:32
一家三口长期吃自制饺子,全都确诊胰腺癌,妻子痛哭:是我错了?

一家三口长期吃自制饺子,全都确诊胰腺癌,妻子痛哭:是我错了?

路医生健康科普
2026-07-19 19:05:06
为何蒋介石明令军统,谁敢在延安动手刺杀毛泽东立刻处决?一反常态的密令,揭开当年国共博弈的真实考量

为何蒋介石明令军统,谁敢在延安动手刺杀毛泽东立刻处决?一反常态的密令,揭开当年国共博弈的真实考量

磊子讲史
2026-07-22 10:41:41
79岁王奎荣将北京140平房子、2000多万存款,全部赠予小37岁妻子

79岁王奎荣将北京140平房子、2000多万存款,全部赠予小37岁妻子

国际阿尝
2026-07-04 09:05:08
6人夺金,3人满分,中国队问鼎!第67届数学奥赛成绩揭晓

6人夺金,3人满分,中国队问鼎!第67届数学奥赛成绩揭晓

史海流年号
2026-07-20 09:11:47
中国外长只待一天就走,日本想“碰瓷”都没门,日本外相慢慢等吧

中国外长只待一天就走,日本想“碰瓷”都没门,日本外相慢慢等吧

超喜欢我
2026-07-22 15:15:25
2026-07-22 16:12:49
果壳 incentive-icons
果壳
科技有意思
28021文章数 4149460关注度
往期回顾 全部

科技要闻

怕了?美财长扬言:严查中国AI

头条要闻

A股史上最大财务造假案判了 马兴田夫妇被判赔13.96亿

头条要闻

A股史上最大财务造假案判了 马兴田夫妇被判赔13.96亿

体育要闻

阿根廷的亚军:单核足球的极限?

娱乐要闻

谢贤离世风波再起!王菲探望细节曝光

财经要闻

美国想对中国AI动手?"大人,时代变了"

汽车要闻

上汽贾健旭谈汽车全球化:出海要合规 欧洲人只爱小车是误解

态度原创

艺术
教育
游戏
公开课
军事航空

艺术要闻

冷军34年前画了幅面具,拍了172.5万

教育要闻

视频丨教育部:我国基础教育总体达到高收入国家平均水平

AI涩涩称霸《老滚5》模组社区!创作者叫苦不迭

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

乌克兰高层爆发严重内斗 泽连斯基撤换"屠夫"总司令

无障碍浏览 进入关怀版