网易首页 > 网易号 > 正文 申请入驻

无人工干预取得35分,谷歌拿下首个属于AI的IMO「真」金牌

0
分享至

AI 发展的速度比我们想象得更快。

就在上个月,我们曾报道顶尖的大语言模型们还在奥数级别的基准测试中集体受挫,而仅仅一个月后,AI 便已能在真正的国际数学奥林匹克竞赛中斩获金牌。

当地时间 7 月 21 日,谷歌 DeepMind 宣布,其研发的人工智能系统在国际数学奥林匹克(IMO,International Mathematical Olympiad)中取得了历史性的突破,正式获得了“金牌”级别的成绩。这标志着人工智能首次在官方认证的 IMO 竞赛中达到如此高的成就,同时也表明 AI 在复杂推理能力上迈出了关键一步。

在今年于澳大利亚举行的第 66 届国际数学奥林匹克竞赛中,谷歌 DeepMind 参赛的 AI 模型“Gemini Deep Think”成功解答了全部六道题目中的五道,最终获得了 35 分(满分 42 分)的优异成绩。根据 IMO 的评分标准,这一分数足以摘得金牌。IMO 主席 Prof. Dr. Gregor Dolinar 评价这些解答“在许多方面都令人震惊”,认为它们“清晰、准确,大部分都容易理解”。

此次谷歌的胜利,不仅在于分数的突破,更重要的是其实现方式也产生了巨大变革。去年,DeepMind 的两个系统 AlphaGeometry 和 AlphaProof 联手获得了银牌,解决了六题中的四题。但当时的系统需要人类专家先将自然语言描述的赛题手动翻译成名为“Lean”的形式化计算机语言,AI 才能进行处理,整个过程耗时两到三天。而今年的 Gemini Deep Think 则完全不同,它是一个能够直接理解并处理自然语言问题的“推理系统”,在与人类选手相同的 4.5 小时竞赛时限内,端到端地完成了从读题到生成严谨数学证明的全过程,无需任何人工干预。

Gemini Deep Think 的成功,得益于谷歌在 AI 推理技术上的最新研究成果。该模型采用了一种被称为“并行思维”(parallel thinking)的先进技术,使其能够同时探索和整合多个潜在的解题思路,而不是像传统 AI 模型那样沿循单一的线性推理路径,从而大大提升了解决复杂问题的效率和创造性。此外,DeepMind 团队还运用了新的强化学习技术,通过一个包含高质量数学解题方案的精选数据库对 Gemini 进行专门训练,使其掌握了更高级的多步推理和定理证明能力。

有意思的是,在解决其中一道许多人类选手需要动用研究生级别数学知识的难题时,Gemini Deep Think 却另辟蹊径,仅凭基础的数论知识就给出了一个“绝妙的观察”和自洽的证明,其解法比许多人类参赛者的更为简洁优雅。这在某种程度上也表明,AI 在复杂问题面前,已经具备了超越常规思路、发现创新解法的潜力。

不过,这次成就的发布过程颇具戏剧性。就在谷歌公布消息的两天前,OpenAI 的一位研究员在社交媒体上抢先宣布,他们的一款实验性 AI 模型也在今年的 IMO 中取得了出色的“金牌”成绩——同样是解出五道题,获得 35 分。

但区别在于,OpenAI 并未正式参与 IMO 的官方评估流程,而是他们组建了一个由三位前 IMO 奖牌得主构成的独立小组来为自己的 AI 打分。而谷歌则是与 IMO 官方合作,由竞赛协调员根据学生评分标准正式评定成绩,也因此,只有谷歌的成绩得到了 IMO 官方的认证。

此外,据多方消息透露,IMO 官方曾请求所有参与测试的 AI 公司在闭幕式后等待一周再公布成绩,以便让焦点首先集中在获奖的青少年学生身上。谷歌 DeepMind 遵守了这一约定,而 OpenAI 则在闭幕式当天就迫不及待地公布了其“自评”的成绩,这种做法在 AI 社区引发了激烈争议。DeepMind CEO Demis Hassabis 在社交媒体上含蓄地讽刺了一下友商:“顺便说一下,我们没有在周五宣布,是因为我们尊重 IMO 委员会的原始要求,即所有 AI 实验室都应该在官方结果得到独立专家验证且学生们理应获得应有的赞誉之后才分享他们的结果。”

值得注意的是,无论是谷歌的 Gemini Deep Think 还是 OpenAI 的模型,都未能攻克本届 IMO 难度最高的第六题。这道题目要求计算覆盖一个给定空间所需的最少矩形数量,最终只有 5 名人类学生成功解出。据悉,Gemini 在解这道题时,从一个错误的假设出发,最终未能找到正确路径。这也从侧面说明,尽管 AI 在逻辑推理方面取得了长足进步,但在面对某些极具挑战性和创造性的问题时,与顶尖的人类智慧相比,仍有其局限性,需要从这些年轻的数学天才身上学习。

著名数学家陶哲轩也在社交媒体上详细分析了评估 AI 能力的复杂性,他表示,AI 系统的表现很大程度上取决于被给予的资源和辅助条件。他用人类参赛者的类比来说明,如果改变竞赛格式(比如给学生几天时间而不是 4.5 小时,或者允许使用工具),那么成绩和排名可能会发生巨大变化。因此,在不同规则下对 AI 的能力进行比较,需要格外谨慎。

但无论如何,这次比赛对谷歌而言,都堪称一次“双赢”——由他们赢两次,不仅证明其在与 OpenAI 等对手的“AI 竞赛”中占据了有利身位,还因为竞争对手本身的抢跑而获得了好名声。

基于这次的成功,谷歌方面也公布了后续的商业化路径:计划向一组由数学家组成的受信任测试者提供一个版本的 DeepMind 模型,之后会将其推广给每月支付 250 美元的 Google AI Ultra 订阅用户。他们相信,这种结合了自然语言流畅性和严谨推理能力的 AI 系统,将成为数学家、科学家和工程师的宝贵工具,最终推动人类知识的边界,加速 AGI 的到来。

参考资料:

1.https://deepmind.google/discover/blog/advanced-version-of-gemini-with-deep-think-officially-achieves-gold-medal-standard-at-the-international-mathematical-olympiad/

2.https://x.com/demishassabis/status/1947337618787615175?ref_src=twsrc%5Etfw%7Ctwcamp%5Etweetembed%7Ctwterm%5E1947337618787615175%7Ctwgr%5Ee2bf7e56b25bf6a4597610749ec8ad1afdee0a50%7Ctwcon%5Es1_&ref_url=https%3A%2F%2Fventurebeat.com%2Fai%2Fgoogle-deepmind-makes-ai-history-with-gold-medal-win-at-worlds-toughest-math-competition%2F

运营/排版:何晨龙

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
果然,中餐才是最牛的!网友:他们整整吃了一年煎饼!

果然,中餐才是最牛的!网友:他们整整吃了一年煎饼!

另子维爱读史
2026-09-29 21:07:58
“我比赛可以开闪光灯” 张继科12年后再胜波尔 大笑模仿王楚钦庆祝

“我比赛可以开闪光灯” 张继科12年后再胜波尔 大笑模仿王楚钦庆祝

风过乡
2026-09-30 12:00:49
大码模特现实里到底多大?

大码模特现实里到底多大?

飛娱日记
2026-05-12 08:27:55
事业没了、婚也离了,被封5年后赵薇再曝近况,瘦到脱相不敢认

事业没了、婚也离了,被封5年后赵薇再曝近况,瘦到脱相不敢认

阿讯说天下
2026-08-30 06:10:34
最新后续:图片被扒,见面当晚“景甜被摸了”?

最新后续:图片被扒,见面当晚“景甜被摸了”?

默默有话说
2026-09-29 12:48:18
噩耗接连传来!刘欢刚走没几日,63岁水均益近况曝光令人心生担忧

噩耗接连传来!刘欢刚走没几日,63岁水均益近况曝光令人心生担忧

生命之泉的奥秘
2026-09-29 01:11:59
中纪委划出红线!领导亲属、基层干部、8大领域,有一个查一个!

中纪委划出红线!领导亲属、基层干部、8大领域,有一个查一个!

职场资深秘书
2026-09-30 10:08:02
被判“无期”的人,每天在监狱里干些什么?说出来你或许不信

被判“无期”的人,每天在监狱里干些什么?说出来你或许不信

无人倾听无人倾听
2026-09-29 23:51:36
聚众两万,但不造反

聚众两万,但不造反

我是历史其实挺有趣
2026-09-29 10:52:04
玄学:泰国白龙王终生不敢来中国,和弟子坦言,749局令他畏惧

玄学:泰国白龙王终生不敢来中国,和弟子坦言,749局令他畏惧

飞云如水
2025-02-08 07:44:27
王刚也没料到,刘欢才离开 3 天,前妻成方圆仅因一个举动口碑飙升

王刚也没料到,刘欢才离开 3 天,前妻成方圆仅因一个举动口碑飙升

观察鉴娱
2026-09-29 09:53:22
阴和俊:我国已建成全世界规模最大的教育体系,拥有总量位居世界第一的研发人员队伍

阴和俊:我国已建成全世界规模最大的教育体系,拥有总量位居世界第一的研发人员队伍

政知新媒体
2026-09-29 15:46:44
水谷隼:中国男乒过去像王楚钦一样的选手有五六个,如今只依赖他一人

水谷隼:中国男乒过去像王楚钦一样的选手有五六个,如今只依赖他一人

观察者网
2026-09-29 20:17:07
这位中将见老战友任省委书记,因工作争议大写信提醒他要注意!

这位中将见老战友任省委书记,因工作争议大写信提醒他要注意!

历史龙元阁
2026-09-29 11:40:17
很久没见像《老江湖》这样的全面的烂片了

很久没见像《老江湖》这样的全面的烂片了

有爱评论区
2026-09-29 10:19:34
刘欢豪宅一览表:装修值千万,客厅能容百人,有私家酒吧,从不请保姆

刘欢豪宅一览表:装修值千万,客厅能容百人,有私家酒吧,从不请保姆

火鱼观点
2026-09-27 19:25:53
234-238 惜败!亚运复合弓女团决赛中国摘银,印度平世界纪录卫冕

234-238 惜败!亚运复合弓女团决赛中国摘银,印度平世界纪录卫冕

小兰看体育
2026-09-30 10:56:57
林彪秘书关光烈拒绝参与政变,为何仍被判刑10年?

林彪秘书关光烈拒绝参与政变,为何仍被判刑10年?

瑾瑜聊情感
2025-08-18 16:45:32
不止师德失范!北理工裴副教授师被开除,履历被深挖:当年高考仅478分,英国水硕,学术硬实力彻底露底

不止师德失范!北理工裴副教授师被开除,履历被深挖:当年高考仅478分,英国水硕,学术硬实力彻底露底

360度看视角
2026-09-30 11:01:12
48岁腹肌杀疯!林志玲短发颠覆全网:女神从不是靠天生

48岁腹肌杀疯!林志玲短发颠覆全网:女神从不是靠天生

传递满满正能量
2026-09-30 08:17:42
2026-09-30 14:03:00
DeepTech深科技 incentive-icons
DeepTech深科技
麻省理工科技评论独家合作
17323文章数 515223关注度
往期回顾 全部

科技要闻

OpenAI凌晨大上新!新助手dots迎战Muse

头条要闻

疑妙瓦底电诈园新据点卫星图公开 建筑群迅速"繁殖"

头条要闻

疑妙瓦底电诈园新据点卫星图公开 建筑群迅速"繁殖"

体育要闻

石雨豪:亚运金牌与背后的十年

娱乐要闻

金鹰这夜,演员争辉,有惊喜,反差

财经要闻

中央财政首次贴息房贷 定向支持首套刚需

汽车要闻

5.1米大车跑云南盘山路,海狮08试驾体验超预期

态度原创

家居
艺术
教育
时尚
军事航空

家居要闻

2026建博会(广州) 公装联探展交流活动

艺术要闻

40岁,她改造170㎡复式房送自己:一个人生活也很精彩

教育要闻

课堂、资源、平台三端发力,天府新区构建数字思政工作体系

老板,我的脑子好像忘在家里了

军事要闻

伊朗最高领袖最新发声:伊朗现已变得独立、强大

无障碍浏览 进入关怀版