网易首页 > 网易号 > 正文 申请入驻

AI拿下IMO满分金牌!小红书dots模型42/42分,比肩全球7位人类天才

0
分享至


IMO满分金牌——这是AI数学推理能力的"图灵测试"级别里程碑

2026年7月21日,一个注定被写进AI史的日子:小红书dots团队带着dots-note 3.0模型参加第67届国际数学奥林匹克(IMO 2026),六道题全部满分,42/42分,全球仅7位人类选手获此成绩

这不是一个"AI又考了个高分"的新闻。IMO是地球上最难的数学竞赛,没有之一。每年全球最顶尖的高中生在IMO上鏖战,能拿满分的寥寥无几。2026年,全球只有7个人类选手拿到了满分金牌。现在,AI也做到了。

更令人震惊的是:dots-note 3.0不依赖形式化语言,直接读取原始LaTeX题目,通过递归自我批判能力端到端完成解题。而且,它还是dots3系列中最轻量级的模型。

"IMO满分金牌这个里程碑,背后是模型递归自我批判能力的突破。不依赖形式化验证就能给出优雅证明,这对数学推理研究是个真信号,做推理方向的值得细读。"——AIHOT编辑推荐语

1 IMO满分意味着什么?不只是"AI会做题"

很多人会问:AI能考IMO满分,跟我们有什么关系?

答案是:IMO满分验证的不是"AI会做题",而是"AI能推理"

IMO的题目不是"1+1=2"的计算题。每道IMO题目都需要创造性的数学思维——你需要从零开始构建证明思路,尝试不同的路径,在遇到死胡同时回溯,最终找到一条优雅的证明路径。这不是"模式匹配"能解决的问题,这是真正的"推理"。

过去,AI在数学推理上的表现一直差强人意。大语言模型可以"背诵"已知的数学定理,但遇到需要原创性思维的新问题时,往往会"胡编乱造"。这就是为什么IMO一直是AI的"终极考场"——它考的不是知识,而是创造力

dots-note 3.0的满分,意味着AI第一次在"需要创造性推理"的顶级智力竞赛中,达到了人类顶尖水平。这不是"AI的记忆力比人好",而是"AI的推理能力开始逼近人类"。


递归自我批判——让AI在解题过程中不断"反思"自己的推理,是这次突破的核心


2 递归自我批判:dots-note 3.0的核心秘诀

dots-note 3.0最引人注目的技术特点是递归自我批判

什么是递归自我批判?简单说,就是让模型在解题过程中不断"反思"自己的推理是否正确。传统的大模型在推理时是"一条路走到黑"——给出一个答案,然后坚持这个答案。但dots-note 3.0不同:它在生成每一步推理后,会主动检查这一步是否正确、是否有漏洞、是否有更优雅的解法。

这就像人类数学家的工作方式:不是"写下一个答案就完事",而是"反复推敲、反复修改、反复验证"。高斯不会因为第一次尝试就得到正确答案而停止——他会寻找更优美的证明。dots-note 3.0的递归自我批判,本质上是在模拟这种"数学家式的思维"。

而且,dots-note 3.0不依赖形式化验证工具(如Lean、Coq等)。这意味着它不需要把数学问题翻译成形式化语言,而是直接读取人类写的LaTeX题目,用人类的数学语言进行推理。这个能力,比依赖形式化工具的方案更接近"人类式的数学思维"。


dots-note 3.0 IMO 2026 核心数据

  • IMO成绩:42/42分,满分金牌

  • 人类对比:全球仅7位人类选手获满分金牌

  • 解题方式:不依赖形式化语言,直接读取原始LaTeX题目

  • 核心技术:递归自我批判

  • 模型规模:dots3系列最轻量级模型

  • 开源状态:预期将开源

  • 团队:小红书 dots 团队

3 小红书做AI?从"种草"到"IMO金牌"

很多人对小红书的印象还停留在"种草平台"。但dots团队在AI数学推理上的突破,让人不得不重新审视这家公司的技术实力。

小红书dots团队并非突然冒出来的。dots系列模型一直在数学推理、代码生成等方向深耕。dots3系列在多个基准测试中都有出色表现。但IMO满分金牌,无疑是最具冲击力的"成绩单"。

这背后是中国AI行业一个值得关注的趋势:非传统AI公司正在AI核心技术上取得突破。不只是BAT和字节,小红书、快手、美团等公司也在AI研发上投入巨资。这些公司有独特的业务场景和海量数据,当它们把AI能力与自身业务深度结合时,往往能产生意想不到的化学反应。

dots-note 3.0预期将开源,这意味着全世界的数学家和AI研究者都可以基于这个模型进行进一步的研究。这不仅是小红书的胜利,也是开源AI社区的胜利。


从"会做题"到"能发现新的数学定理"——AI数学推理的下一站


4 从IMO满分到"AI数学家":还有多远?

IMO满分是一个里程碑,但它不是终点。从"能解IMO题"到"能发现新的数学定理",中间还有巨大的鸿沟。

IMO的题目,再难也是"已知有解"的。每道题都有标准答案,评委会提前验证过。AI做的是"找到已知的答案"。但真正的数学研究,面对的是"不知道有没有解"的问题——你甚至不知道答案是否存在,不知道这条路是否走得通。

这种"在不确定性中探索"的能力,是当前AI不具备的。人类数学家可以花几年甚至几十年研究一个猜想(比如费马大定理,花了358年才被证明),但AI目前还不能做这种"长期、开放式的探索"。

不过,腾讯混元同日发布的Hyra-1.0给出了一个方向:递归自我改进的研究智能体。Hyra在55个数学开放问题中刷新了29个历史最好结果。如果dots的"递归自我批判"和Hyra的"递归自我改进"结合起来,AI自主进行数学研究的那一天,可能比我们想象的更近。


AI数学推理的三条技术路线

形式化验证路线(Lean/Coq):将数学问题翻译成形式化语言,用定理证明器验证。优点是100%可靠,缺点是翻译成本高、不灵活。

端到端推理路线(dots-note 3.0):直接读取人类数学语言,自主推理。优点是灵活、接近人类思维,缺点是可靠性不如形式化验证。

递归自我改进路线(Hyra-1.0):让AI在推理过程中不断改进自己的策略。优点是可能发现人类未发现的解法,缺点是稳定性不足。


5 冷静看待:IMO满分背后的"冰山"

尽管dots-note 3.0的IMO满分令人振奋,但几个现实问题值得冷静思考:

42分≠42分。AI的42分和人类的42分,意义不完全相同。人类选手在考场上只有几个小时,不能查阅资料,不能重试。AI的"考试环境"是否与人类完全一致?如果AI可以多次尝试、可以选择最优答案,那这个"满分"的含金量需要更透明的评估标准。

最轻量级模型拿满分,说明什么?dots-note 3.0是dots3系列最轻量级模型。这当然说明了"小模型也能有大能力",但反过来也说明:IMO题目可能被"过拟合"了。如果模型在训练数据中见过类似题目,满分就不完全代表"推理能力"。

从"解题"到"发现"的鸿沟。如前所述,IMO题目是"已知有解"的。真正的数学研究是"探索未知"。AI能否从"解题工具"进化为"发现工具",是下一个需要回答的问题。

IMO满分金牌是一个里程碑,但它的真正意义不在于"AI比人类聪明",而在于"AI终于开始理解'推理'这件事了"。当AI不仅能"算"出答案,还能"想"出答案、"批判"自己的答案时,我们离通用人工智能就近了一步。这条路,刚刚开始。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
华人已经被盯上! 澳洲公布新规: 先查中国人! 大批人抛售, 申请量暴跌

华人已经被盯上! 澳洲公布新规: 先查中国人! 大批人抛售, 申请量暴跌

澳微Daily
2026-08-21 16:04:19
11岁张姩菡和舅舅看电影!瘦到脱相戴近视镜,眉眼越来越像张雪峰

11岁张姩菡和舅舅看电影!瘦到脱相戴近视镜,眉眼越来越像张雪峰

林轻吟
2026-08-22 12:09:29
德国财长破防撂狠话,中国再不按规矩办事,德国就对中国不客气

德国财长破防撂狠话,中国再不按规矩办事,德国就对中国不客气

一簌月光
2026-08-23 01:09:28
余承东再喊“遥遥领先”,喊话苹果用户尝试买个阔直板备用试试!网友:试试就转正

余承东再喊“遥遥领先”,喊话苹果用户尝试买个阔直板备用试试!网友:试试就转正

大白聊IT
2026-08-21 00:36:44
38岁后才发现:当初花重金买的东西,全都沦为了“时代的眼泪”

38岁后才发现:当初花重金买的东西,全都沦为了“时代的眼泪”

优活Life
2026-08-16 12:15:03
梅西导演大逆转!4分钟独造2球,戏耍8人防线,连刷6大纪录

梅西导演大逆转!4分钟独造2球,戏耍8人防线,连刷6大纪录

石场阿鑫
2026-08-22 20:07:19
紧急预警!超强台风沙德尔直扑东海,江浙沪直面硬刚,风雨大降温要来了

紧急预警!超强台风沙德尔直扑东海,江浙沪直面硬刚,风雨大降温要来了

糖逗在娱乐
2026-08-23 04:38:51
油价大跌超2.19元/升,2026年下跌5次的油价,8月28日或大涨近400元/吨

油价大跌超2.19元/升,2026年下跌5次的油价,8月28日或大涨近400元/吨

油价早知道
2026-08-23 02:31:33
弹道导弹再次零拦截,基辅部分超市货架清空!俄军炸弹击中婴儿床,奇迹般没爆炸

弹道导弹再次零拦截,基辅部分超市货架清空!俄军炸弹击中婴儿床,奇迹般没爆炸

鹰眼Defence
2026-08-21 15:47:10
知识分子一旦折节沦丧,那将是几代人走不出的寒冬!

知识分子一旦折节沦丧,那将是几代人走不出的寒冬!

胖胖说他不胖
2026-08-22 10:00:25
0-2!曼联爆冷不敌英超升班马,卡里克创耻辱,3人不及格踢丢主力

0-2!曼联爆冷不敌英超升班马,卡里克创耻辱,3人不及格踢丢主力

小火箭爱体育
2026-08-22 21:39:01
仅一夜!NBA三方交易达成,美媒评5大新星申请换队,快船成大赢家

仅一夜!NBA三方交易达成,美媒评5大新星申请换队,快船成大赢家

失宠的小野猪
2026-08-22 14:25:36
陳自瑤海岸派福利透視婚紗大曬長腿事業線 網民暴動:血壓爆升

陳自瑤海岸派福利透視婚紗大曬長腿事業線 網民暴動:血壓爆升

粤睇先生
2026-08-23 00:45:03
市场被《牛来》反噬,新片集体扑街,最惨一部票房325元

市场被《牛来》反噬,新片集体扑街,最惨一部票房325元

光影新天地
2026-08-21 16:08:40
原来贵的东西真有贵的道理!网友:当初嫌贵,买完之后直接真香了

原来贵的东西真有贵的道理!网友:当初嫌贵,买完之后直接真香了

另子维爱读史
2026-08-22 21:08:52
全球首发玄戒O3 卢伟冰已换上小米MIX Ultra

全球首发玄戒O3 卢伟冰已换上小米MIX Ultra

快科技
2026-08-22 23:34:06
“长得不好看,真考不上!”老师劝退视频火了,说得已经很委婉了

“长得不好看,真考不上!”老师劝退视频火了,说得已经很委婉了

泽泽先生
2026-08-20 15:35:06
老人因“鱼头对自己”怒斥小辈,被怼到哑口无言:没生在紫禁城,就别那么多穷规矩!

老人因“鱼头对自己”怒斥小辈,被怼到哑口无言:没生在紫禁城,就别那么多穷规矩!

妍妍教育日记
2026-08-16 10:05:09
钱不好挣了,2026年、2027年、2028年这三年,请牢记5大忠告

钱不好挣了,2026年、2027年、2028年这三年,请牢记5大忠告

猫叔东山再起
2026-08-22 09:35:08
“枕头被子”收入逼近主业,亚朵能筑牢利润护城河吗?

“枕头被子”收入逼近主业,亚朵能筑牢利润护城河吗?

界面新闻
2026-08-22 08:22:27
2026-08-23 08:08:49
星海情报局 incentive-icons
星海情报局
关注“中国制造”的星辰大海
1406文章数 2031关注度
往期回顾 全部

科技要闻

苹果裁员200人:Vision Pro砍游戏团队

头条要闻

追觅造车办公地工位大片闲置 几十个总监集中在外求职

头条要闻

追觅造车办公地工位大片闲置 几十个总监集中在外求职

体育要闻

字母+汤神,有没有搞头?

娱乐要闻

《空枪》预测票房缩水,手握王炸都没赢

财经要闻

蔡昉解读经济:扩大消费需求的政策思考

汽车要闻

钛9全球首秀/四季度上市 方程S系列内饰车展亮相

态度原创

时尚
旅游
房产
家居
健康

真爱返场|| 5年如一日的心头好,这个价格真香

旅游要闻

呼伦贝尔的樟子松   艾平

房产要闻

两大热盘即将入市!三亚又一批安居房狠货要炸场了!

家居要闻

2026建博会(广州) 公装联探展交流活动

“矫正神器”真能治好脊柱侧弯吗?

无障碍浏览 进入关怀版