网易首页 > 网易号 > 正文 申请入驻

超越IMO金牌?谷歌创超难FirstProof数学挑战新纪录

0
分享至

来源:市场资讯

(来源:机器之心)

编辑|冷猫

去年 7 月的 IMO 数学奥林匹克竞赛中,两大人工智能公司抢夺竞赛「金牌」成绩的闹剧搞得沸沸扬扬。

当时 OpenAI 和 谷歌 同时声称取得竞赛金牌,而 OpenAI 因绕过官方竞赛规则提前官宣,遭到广泛吐槽;谷歌 DeepMind 的 Gemini 进阶模型成为首个获得奥赛组委会官方认定为金牌的 AI 系统。

竞赛与真正的数学研究之间,仍然存在一道明显的分界线。

在此之后,AI 智能体飞速发展,解决数学问题的能力不再仅依靠模型的推理能力。AI 智能体已经可以开始自己做数学,不只是解题,更能够进行数学研究,而且研究的还是顶尖数学家都要挠头的问题,这意味着什么?

近日,来自谷歌 DeepMind ,由 Gemini 3 Deep Think 驱动的最新数学研究智能体 Aletheia 在首届 FirstProof 挑战中,自主解决了 10 道高难度研究问题中的 6 道,成为创下了该数学挑战赛的最佳纪录。


曾带队实现 AI IMO 金牌成绩的 DeepMind 超人类推理方向负责人 Thang Luong 表示,这一成果的分量超过去年 AI 在 IMO 测试中获得金牌的表现。

相关论文《Aletheia tackles FirstProof autonomously》已发布在 arXiv,并且团队在 Github 上公开了解决 FirstProof 问题的提示词与输出结果。


  • 论文标题:Aletheia tackles FirstProof autonomously

  • 论文链接:https://arxiv.org/pdf/2602.21201

  • 提示词与输出结果:https://github.com/google-deepmind/superhuman/tree/main/aletheia

FirstProof:把 AI 放进真实的数学研究现场

FirstProof 是一项专门为评估 AI 数学研究能力而设计的实验性挑战。项目由多位活跃在不同数学分支的一线研究者发起,题目全部来自真实科研过程中的命题,被提出作为评估当前人工智能能力的测试。

这些问题在挑战启动前从未公开证明,组织方提前将标准证明加密保存,以尽量排除训练数据泄露的可能。最终提交的答案,需要由领域专家人工审阅,判断其逻辑严密性与学术可接受度。评价标准接近论文审稿,而非自动判分。

这种设计刻意提高了门槛。它测试的,是 AI 在陌生问题上进行长期推理与结构构造的能力。换句话说,FirstProof 关心的,是系统是否具备参与数学研究的潜力。

这些问题于 2026 年 2 月 5 日发布,并设定了截止时间为太平洋时间 2026 年 2 月 13 日晚上 11:59 ,解决方法在截止后在互联网上发布。

这项评估本身极其困难,能够真正理解这些问题的专家屈指可数。关键的一点是:Aletheia 的所有解答均在没有任何人工干预的情况下生成,并且在 FirstProof 挑战规定的时间范围内提交。


FirstProof 的第一作者确认了这一事实:


研究团队运行了两个版本的 Aletheia(两者仅在底层基础模型上有所不同),它们都由 Gemini DeepThink 提供支持。综合多数专家评审意见,这两个系统共同解决了 10 道题中的 6 道(第 2、5、7、8、9、10 题)。我们注意到,专家们对第 8 题的评估并不完全一致。


Aletheia 在 FirstProof 上的性能总结。专家评估列显示了在咨询的总专家人数中,有多少专家将解决方案评为正确。仅在 P8 上的评估不是一致的。

Aletheia 的「解题分析」

两个智能体在同样的 FirstProof 十个问题的执行结果如下所示:


在 FirstProof 的 10 道问题中,Aletheia 为其中 6 道题(P2、P5、P7、P8、P9、P10)生成了候选解答。在「best-of-2」的评估设置下,根据多数专家的评审意见,这 6 道题都被认定为在该解释框架下已正确解决。

Aletheia A 与 Aletheia B 针对相同的六道题目都生成了候选解答。单独来看,每个智能体都至少出现过一次「假阳性」(false positive),但在 best-of-2 的评估机制下,它们共同为六道题目都提供了可信的解答。这一结果相比 2025 年 12 月用于解决 Erdős 问题的 Aletheia 版本,在准确率上有明显提升。

不过,P8 的评估并非一致通过 ——7 位专家中有 5 位给出了「Correct」的评价。对于另外 4 道题(P1、P3、P4、P6),两个智能体都没有给出解答:要么明确输出「No solution found」(未找到解答),要么在时间限制内没有返回任何结果。

研究团队认为,Aletheia 具备一种「自我筛选」机制,这也是 Aletheia 的关键设计原则之一。

在将 AI 扩展为数学研究助手的过程中,可靠性才是首要瓶颈。如果智能体给出错误的「幻觉」答案,会极度浪费人类专家用于验证结果的时间与精力,与提高研究效率和自动化的目标背道而驰。

此外,解决问题的推理成本也是非常重要的指标。


在图中展示了每个候选解的推理成本,并将其表示为相对于 Erdős-1051 解答推理成本的倍数。不难发现,Aletheia 在所有问题上,推理成本都高于 Erdős-1051。

尤其是 P7,其推理成本比此前观察到的规模高出一个数量级。研究者称,这一方面是因为 Generator 子智能体在生成候选解时消耗了大量计算资源,另一方面是因为需要更多轮交互才能通过 Verifier 子智能体的验证。

总结

数学研究包含多个环节:提出问题、建立框架、寻找关键结构、完成证明。当前系统显然还无法全面承担所有角色,但它已经开始在证明与验证环节发挥作用。

未来的研究场景或许会发生变化。人类研究者提出方向与核心思想,AI 负责高强度的路径搜索与形式化验证,再由人类进行理论整合与升华。这种协作模式,正在逐渐成形。

数学长期以来被视为人类理性能力的高地。如今,AI 正在这里取得实质性突破。当机器开始稳定地完成研究级证明,我们或许需要重新思考一个问题:

在未来的数学论文作者名单中,AI 会以什么身份出现?

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
七八十年代流行全国的“的确良”,为何突然消失了?其实它改了名

七八十年代流行全国的“的确良”,为何突然消失了?其实它改了名

云霄纪史观
2026-01-06 02:00:19
韦伯望远镜拍到时空弯曲,位于120亿光年外,爱因斯坦又对了

韦伯望远镜拍到时空弯曲,位于120亿光年外,爱因斯坦又对了

观察宇宙
2026-02-26 18:50:03
“我就是她取精生子的工具”清华学霸哭诉,撕开了女富豪的遮羞布

“我就是她取精生子的工具”清华学霸哭诉,撕开了女富豪的遮羞布

百态中的情感起伏
2026-02-23 12:25:50
62岁刘金山现状:尽显富态,住北京四合院,10岁独女成全家团宠

62岁刘金山现状:尽显富态,住北京四合院,10岁独女成全家团宠

查尔菲的笔记
2026-02-26 16:21:22
46岁谢霆锋与陈坤亮相,一个脸垮一个臃肿,骨相和皮相差距很明显

46岁谢霆锋与陈坤亮相,一个脸垮一个臃肿,骨相和皮相差距很明显

查尔菲的笔记
2026-02-26 14:16:04
外交部:德国总理默茨此次访华成果丰硕、富有意义

外交部:德国总理默茨此次访华成果丰硕、富有意义

环球网资讯
2026-02-26 15:58:26
勇士懵了!打不上球的库明加在老鹰升级成锋线巨头

勇士懵了!打不上球的库明加在老鹰升级成锋线巨头

湖人侃球师
2026-02-25 23:25:03
马筱梅前夫郑扬融底细曝光!家境优渥却留不住她,原因太现实

马筱梅前夫郑扬融底细曝光!家境优渥却留不住她,原因太现实

揽星河的笔记
2026-02-26 16:19:41
赢了日本队,依旧不乐观!中国男篮出线前景探究,下场仍是生死战

赢了日本队,依旧不乐观!中国男篮出线前景探究,下场仍是生死战

萌兰聊个球
2026-02-26 22:05:53
门乔被杀只是开始!毒贩向墨西哥政府宣战:这届世界杯,别想看!

门乔被杀只是开始!毒贩向墨西哥政府宣战:这届世界杯,别想看!

瓜哥的动物日记
2026-02-25 15:33:17
外媒首次承认:中国核潜艇数量已超俄罗斯,096 更将改变力量格局

外媒首次承认:中国核潜艇数量已超俄罗斯,096 更将改变力量格局

议纪史
2026-02-25 23:20:03
不被任何人拿捏的顶级思维:不要回答别人的问题,要回答别人的目的

不被任何人拿捏的顶级思维:不要回答别人的问题,要回答别人的目的

古代经典
2026-02-25 15:40:12
国网四川省电力公司招人中!约700人!

国网四川省电力公司招人中!约700人!

掌上金牛
2026-02-26 12:07:05
全国统一执行!3月1日起,公职人员戴上紧箍咒,老百姓迎来大便利

全国统一执行!3月1日起,公职人员戴上紧箍咒,老百姓迎来大便利

福建平子
2026-02-25 10:54:52
35秒内男篮吃2T+1违体!富永空气2+1令人发笑 裁判送日本5罚1球权

35秒内男篮吃2T+1违体!富永空气2+1令人发笑 裁判送日本5罚1球权

颜小白的篮球梦
2026-02-26 20:50:29
日本队太嚣张,宣布重要决定,中国男篮被动收好消息,赢球稳了

日本队太嚣张,宣布重要决定,中国男篮被动收好消息,赢球稳了

宗介说体育
2026-02-26 09:31:08
35岁中国音乐家在美身亡:路边换轮胎不幸被卡车撞倒,曾是中美音乐交流中坚力量

35岁中国音乐家在美身亡:路边换轮胎不幸被卡车撞倒,曾是中美音乐交流中坚力量

红星新闻
2026-02-26 12:36:32
河南牧原离职员工家属发文,吐槽“想结婚来牧原,想离婚来牧原”,董事长秦英林现身评论区:奖励2000元;员工:钱已收到

河南牧原离职员工家属发文,吐槽“想结婚来牧原,想离婚来牧原”,董事长秦英林现身评论区:奖励2000元;员工:钱已收到

大象新闻
2026-02-26 20:51:30
印陆军前参谋长终于承认:印军白死了!加勒万那夜,输的不是胆量

印陆军前参谋长终于承认:印军白死了!加勒万那夜,输的不是胆量

梁濆爱玩车
2026-02-26 00:45:15
欧冠附加赛皇马2-1险胜本菲卡,赛后不得不承认的三大事实!

欧冠附加赛皇马2-1险胜本菲卡,赛后不得不承认的三大事实!

田先生篮球
2026-02-26 09:43:43
2026-02-26 23:35:00
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
2280423文章数 5561关注度
往期回顾 全部

科技要闻

单季营收681亿净利429亿!英伟达再次炸裂

头条要闻

男子因银行系统错误"欠款1000万亿":工厂可能会被拍卖

头条要闻

男子因银行系统错误"欠款1000万亿":工厂可能会被拍卖

体育要闻

从排球少女到冰壶女神,她在米兰冬奥练出6块腹肌

娱乐要闻

向华强公开表态 财产留给儿媳妇郭碧婷

财经要闻

中国AI调用量超美国 4款大模型霸榜前5

汽车要闻

40岁的吉利,不惑于内外

态度原创

艺术
教育
手机
公开课
军事航空

艺术要闻

2025第三届全国水粉画大展 | 入选作品选刊

教育要闻

教育部将实施学生体质强健计划,提升学生健康水平

手机要闻

不止魅族,曝还有厂商暂停下一代旗舰研发

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

美政府给新伊核协议设限内容遭披露

无障碍浏览 进入关怀版