网易首页 > 网易号 > 正文 申请入驻

小红书与中科院突破:反向学习法实现AI数学推理能力提升11.5分

0
分享至


这项由小红书技术团队与中国科学院自动化研究所联合开展的研究,以预印本形式发布于2026年5月,论文编号为arXiv:2605.11609。感兴趣的读者可通过该编号在arXiv平台查阅完整原文。

当你辅导一个孩子解数学题时,你可能遇到过这样的困境:如果你提前把答案告诉他,他往往只会机械地套用你给出的那条路径,完全不愿意自己动脑筋探索其他解法。这种情况下,告诉他答案反而害了他——因为他失去了独立思考的机会。现如今,AI在学习数学的时候,也掉进了完全相同的陷阱。

研究团队发现,当前一种流行的AI训练方法叫做"自蒸馏"(self-distillation),其思路听起来很聪明:让AI自己既当学生又当老师,给老师版本看正确答案,然后让学生版本向老师学习。然而在数学推理这个领域,这种方法在多个主流AI模型上几乎全军覆没,表现甚至比不用这种方法的基线还差。这是为什么?又该怎么修?

研究团队提出了一个反直觉的解决方案:既然向老师学习会有问题,那就反着来——主动远离老师的做法。这套方法被命名为"反自蒸馏"(Anti-Self-Distillation,简称AntiSD)。在五个规模从40亿到300亿参数不等的AI模型上,AntiSD不仅让模型以快2到10倍的速度达到原先的训练效果,最终准确率更是最多提升了11.5个百分点。

一、老师知道答案,反而害了学生

要理解这个问题的根源,先从"自蒸馏"的工作原理说起。在标准的强化学习训练中,AI会不断尝试解题,每次答对就得一分,答错就不得分。这种方式就像给孩子做判断题——只知道对错,不知道哪一步做错了,学习效率很低。

自蒸馏的出现正是为了解决这个问题。它的做法是:拿同一个AI模型扮演两个角色——"学生版本"正常解题,"老师版本"则在看过正确答案之后,对学生写的每一个字词重新打分。学生版本再向老师版本学习,从而获得比单纯对错反馈更细致的指导信号。

听起来很合理,对吧?但研究团队发现了一个致命的结构性缺陷。他们分析了老师版本对每一个词的态度,结果发现了一个清晰的两极分化模式。

当老师版本看过正确答案之后,它对某些词语会变得极度自信——比如"因此"、"代入"、"成立"这类词,因为它已经知道推导方向是对的,这些词在正确推导中自然而然就会出现。研究团队把这类词称为"走捷径的词"。与此同时,老师版本对另一类词则变得特别排斥——比如"等等"(Wait)、"或许"(Maybe)、"换个角度"(Alternatively)。这些词代表着重新审视问题、探索多种可能的思维过程。但老师版本已经知道正确答案了,自然觉得这些"犹豫的词"没有必要。

于是标准自蒸馏的实际效果变成了:让AI学会避开探索性思维,直奔它认为正确的路径。这在数学上是灾难性的,因为复杂数学题恰恰需要大量的"等等,让我换个思路试试"。这也解释了为什么研究者们普遍观察到一个现象:用自蒸馏训练的AI,回答会越来越短——不是因为它变聪明了,而是因为它被训练成了不再探索。

研究团队用一个信息论工具——逐点互信息(Pointwise Mutual Information,PMI)——严格证明了这个分析。简单来说,这个工具衡量的是"知道了答案之后,某个词出现的概率是升高了还是降低了"。升高的词就是"走捷径的词",降低的词就是"探索性的词"。标准自蒸馏奖励前者、惩罚后者,方向完全错了。

二、反着学:远离老师,反而找到自己的路

找到了问题所在,修复思路就直接了当:既然老师的信号方向错了,那就反过来用。

标准自蒸馏是让学生往老师靠近,AntiSD则是让学生主动往老师的反方向走。用数学语言表达就是:原来是"最小化学生和老师之间的差异",现在变成了"最大化学生和老师之间的差异"。这一字之差,让每个词的信号方向全部翻转——原来被奖励的"走捷径的词"现在受到压制,原来被惩罚的"探索性词语"现在得到鼓励。

这有点像考试备考时的一个反常策略:与其死记老师给的标准答案,不如刻意练习那些老师没有强调、但自己容易想不到的解题路径。

不过,单纯反向学习会带来一个新问题:没有一个天然的"停止时机"。原来向老师靠近是有终点的——靠得足够近就停了。但反向远离不一样,理论上可以一直远下去直到出问题。为此,研究团队引入了两个附加设计。

第一个是选择更合适的"差异度量方式"。研究团队选择了詹森-香农散度(Jensen-Shannon Divergence,JSD),而非另一种常见的KL散度。这里有个重要的工程考量:在实际训练数据中,"探索性词语"出现的频率比"走捷径的词语"更高,而且有些极端情况下的信号值会达到负20以下,非常夸张。JSD的数学特性能自动给探索性词语那一侧的信号设置一个上限(约为0.347),避免极端值主导整个训练过程。走捷径那一侧则没有上限,确保极端的走捷径行为受到强力压制。

第二个是"熵触发开关"。当老师版本自己也变得过度自信——比如它已经完全收敛到某个固定模式,每个词都确定无疑——这时候老师和学生之间的差异信号就不再有信息价值,都是噪音了。研究团队设计了一个自动监控机制,持续追踪老师版本每个词位置上的"不确定程度"(用信息熵衡量)。一旦这个不确定程度跌破某个阈值,就把反自蒸馏的训练信号关掉;等老师的不确定程度恢复正常,再重新开启。这种设计参考了电子电路中的"施密特触发器"原理,能有效避免在临界点附近反复开关抖动。

整个方法的实现非常轻量。只需要在原有的训练流程中,多做一次带有正确答案的前向推理(forward pass),用来计算老师版本对每个词的概率,然后根据公式算出每个词的权重,加到原有的训练信号里就行了。没有额外的模型,没有额外的数据,计算开销几乎可以忽略。

三、实验结果:效率和准确率双双飙升

研究团队在五个主流开源AI模型上进行了完整测试,涵盖Qwen3-8B、Qwen3-4B-IT-2507、Olmo3-7B-IT、Olmo3-7B-TK和Qwen3-30B-A3B,参数规模从40亿到300亿不等。训练数据使用了DAPO-Math-17k这个数学题数据集,共训练200步。评估则在AIME 2024、2025、2026(美国数学邀请赛)、HMMT 2025(哈佛-MIT数学竞赛)和MinervaMath五个基准上进行。

结果非常一致地呈现出三个规律。

第一个规律是"点火速度"大幅提升。AntiSD从训练第一步就能提供有意义的逐词信号,不需要等待稀疏的对错反馈慢慢累积。在Qwen3-4B-IT-2507这个模型上,AntiSD仅用大约30步就达到了标准GRPO训练需要150步才能达到的训练奖励水平。换算成倍数,AntiSD在不同模型上达到GRPO基线准确率的速度是后者的2到10倍。对于研究者来说,训练成本大幅下降意味着可以用同样的算力探索更多方向。

第二个规律是"最终准确率"全面提升。在所有五个模型上,AntiSD的最终平均准确率都超过了标准GRPO。提升幅度从最小的2.1个百分点(Olmo3-7B-TK,这个模型的基线本来就已经很强)到最大的11.5个百分点(Qwen3-8B)。在最难的HMMT 2025竞赛题上,Qwen3-8B的得分从39.2%提升到了54.4%,提升幅度达到15个百分点。

为了验证提升不是靠"押宝"少数几道题来的,研究团队还测试了pass@k指标,也就是用32次机会来回答同一道题,看能解出多少道题。AntiSD在32次机会的宽松条件下依然领先GRPO大约7到10个百分点,说明它确实解锁了GRPO根本无法解决的题目,而不是靠减少随机性来凑分。

第三个规律是"标准自蒸馏全面崩溃"。在所有五个模型上,使用正向自蒸馏的结果都比不用自蒸馏的基线差,有时差距惊人——Qwen3-8B上,标准自蒸馏的平均分是30.6,而不用的是57.4,差了将近27个百分点。这证实了之前理论分析的预测:把有答案的老师的信号方向用错了。

研究团队还做了一个有意思的延伸实验:在代码编写任务上,AntiSD同样让Qwen3-8B在HumanEval+上提升1.2个百分点、在MBPP+上提升2.3个百分点。虽然提升幅度没有数学任务那么大,但方向完全一致,说明这个方法的有效性不局限于数学。

四、拆解每个零件,哪个最重要

为了搞清楚到底是哪个设计起了关键作用,研究团队做了详细的消融实验——也就是一次只改变一个设计选择,看效果如何变化。

其中有一个实验最能说明问题:如果把老师的正确答案信息完全去掉,只让模型基于自己的概率来反向学习,会怎样?结果是三个模型无一例外地在大约70步内彻底崩溃——训练奖励归零,回答越来越长直到超出上限,模型进入无法恢复的死循环。这清楚地说明,AntiSD有效的关键不是"反向学习"这个动作本身,而是"以老师和学生之间的差异"作为信号来反向学习。去掉老师的正确答案,信号就没有了依托,反而会放大模型原本的任何偏向,形成正反馈崩溃。

另一个有趣的发现是关于熵触发开关的。在Qwen3系列模型上,去掉开关后,模型确实先跑得更快——在大约40步时就达到了0.97的训练奖励——但随即在90步左右因为老师版本过度自信而崩溃。而在Olmo3-7B-IT模型上,同样去掉开关,却能撑过全程200步而不出问题。差异来自于这两类模型的初始信息熵水平:Qwen3模型起步时每个词的不确定程度大约是0.4纳特,距离"完全确定"的临界点不远;Olmo3模型起步更高,有足够的余量不需要开关保护。这说明开关起到的是"跨模型保险"的作用,而非针对某个特定模型调整的参数。

在具体的数学形式选择上,研究团队比较了JSD和KL散度的反向版本。结果显示,用KL散度的反向版本在Qwen3-4B-IT-2507上直接失败了,平均分只有49.5,不仅没有超过GRPO基线,甚至在整个训练过程中都无法稳定提升。这验证了之前的分析:KL散度在探索性词语那一侧没有上限,极端信号值过大,导致训练不稳定。

此外,研究团队还测试了"加性合并"和"乘性合并"两种方式把AntiSD的信号加入原有训练信号中。加性方式效果更好,理由也很直觉化:在对错信号很弱的情况下——比如模型面对一道极难的题,几乎所有尝试都失败了——乘性方式会把AntiSD的信号一起缩小到接近零,恰恰在最需要探索性引导的时候失去了它的作用。加性方式则不受此影响,始终保持独立的贡献。

研究团队还验证了一个实用场景:能不能在一个已经用标准方法训练饱和的模型上,再叠加AntiSD?他们从Qwen3-8B的标准训练终点重新出发,只再跑50步AntiSD,结果在30步内就基本追上了从零开始训练AntiSD整整200步的效果。这说明AntiSD的信号对已经很强的模型依然有价值——它照亮的是那些靠对错反馈永远无法抵达的角落。

五、为什么这件事比看起来更重要

从技术上来讲,AntiSD实际上提供了一个不需要人工标注、不需要额外模型的"逐步奖励信号"。研究团队在论文中证明了,把每一步的信号加总起来,恰好等于"在知道正确答案之后,对整个回答的综合评价"。这意味着这个逐步信号在理论上不会改变最优策略的集合,只是帮助更快、更准确地找到那些最优策略。

更深层的意义在于,这项研究从一个实验失败开始——自蒸馏在数学上不管用——然后通过精确的理论分析找到了失败的根源,再针对根源设计了一个最小改动的修复方案。整个过程是标准的科学推进路径,而得到的结论出人意料地干净:只需要翻转一个符号,加上一个自动触发的保险,就能让一个普遍失败的方法变成一个系统性成功的方法。

说到底,这项研究揭示的是一个更普遍的道理:在学习复杂推理的时候,知道"应该往哪里走"并不总是好事,有时候反而需要保护那些"还不确定要往哪里走"的时刻。探索本身就是价值的来源,而任何会压制探索的训练信号,都可能在无意间把模型训练成了一个只会背捷径的优等生,而不是真正会思考的问题解决者。

当前研究的评估范围主要集中在数学推理,以及一个初步的代码任务测试。研究团队也坦诚,AntiSD的理论分析描述的是每一步的局部信号特性,而非整个训练过程的全局收敛保证。多轮对话、更大规模的模型,以及更丰富的特权信息形式,都是值得继续探索的方向。有兴趣深入了解具体数学推导和实验细节的读者,可以通过arXiv:2605.11609查阅完整论文。

Q&A

Q1:AntiSD的"反自蒸馏"为什么反向学习老师反而会更好?

A:标准自蒸馏让AI向看过答案的老师靠近,但老师知道答案后会偏爱"结论性词汇"、压制"探索性词汇",导致AI越来越不会独立探索。AntiSD把这个信号方向翻转,主动压制"走捷径词汇"、鼓励"探索性词汇",反而帮助AI保留了解复杂题目所需的多路径搜索能力。

Q2:AntiSD训练速度快2到10倍,意味着什么?

A:意味着同样的算力和时间可以训练出更强的模型,或者用更少的资源达到原来的效果。对于需要大量迭代的AI研究团队来说,这种效率提升直接降低了训练成本,也让更快速地探索不同方案成为可能。

Q3:AntiSD方法是否可以用在已经训练好的AI模型上继续提升?

A:可以。研究团队验证了在一个已经用标准方法训练到饱和的Qwen3-8B模型上,只需额外运行30步AntiSD,就基本追上了从头训练AntiSD整整180步的效果。说明这个方法可以作为"增强补丁"叠加在现有模型上,而不必从零开始重新训练。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
高僧临终顿悟:人到中年,最好的养生,是放过亲人,渡好自己

高僧临终顿悟:人到中年,最好的养生,是放过亲人,渡好自己

荷兰豆爱健康
2026-10-01 11:36:05
《GTA6》海滩都是比基尼:肌肉线条细节 太真实了!

《GTA6》海滩都是比基尼:肌肉线条细节 太真实了!

游民星空
2026-09-30 16:19:34
皇马官方:已提交大量证据,欧足联应尽快推进调查

皇马官方:已提交大量证据,欧足联应尽快推进调查

体坛周报
2026-10-01 23:23:14
三星新机突然曝光:10月2日,这外观有点意思

三星新机突然曝光:10月2日,这外观有点意思

手机讲坛
2026-10-02 00:09:00
13场6球4助攻表现很不错,24岁的他却身价暴跌1500万欧元?

13场6球4助攻表现很不错,24岁的他却身价暴跌1500万欧元?

里芃芃体育
2026-10-02 03:00:08
售罄的“罄”怎么读?千万别读qìn或xīn,丢不起那个人!

售罄的“罄”怎么读?千万别读qìn或xīn,丢不起那个人!

语丝纪
2026-10-02 00:55:54
只有我一个人这样看待刘欢之死吗?

只有我一个人这样看待刘欢之死吗?

下岗女神
2026-09-30 21:32:22
中国女篮亚洲杯12人推荐:内线大洗牌,3后卫应破格录用

中国女篮亚洲杯12人推荐:内线大洗牌,3后卫应破格录用

男足的小球童
2026-10-01 16:22:19
海南龙凤胎日夜啼哭,医院查不出病因,保姆查看监控后发现真相

海南龙凤胎日夜啼哭,医院查不出病因,保姆查看监控后发现真相

悬案解密档案
2025-05-19 14:35:42
葡萄牙球迷现场力挺主帅:我们爱你!热苏斯:C罗离队没有让我们分裂

葡萄牙球迷现场力挺主帅:我们爱你!热苏斯:C罗离队没有让我们分裂

念洲
2026-10-02 07:01:27
葡媒:胜利体育总监见证热苏斯和C罗私下会谈,足协高层均缺席

葡媒:胜利体育总监见证热苏斯和C罗私下会谈,足协高层均缺席

懂球帝
2026-10-02 01:23:09
俄罗斯发出警告,北约回应

俄罗斯发出警告,北约回应

参考消息
2026-10-01 16:10:31
特朗普与内塔尼亚胡通话:迪拜航空事故凶手不是恐怖分子就是疯子

特朗普与内塔尼亚胡通话:迪拜航空事故凶手不是恐怖分子就是疯子

阿尔卑斯瞭望
2026-10-01 16:34:42
奚梦瑶陪婆婆逛街太乖巧!穿白外套比何猷君高半头,四太这双腿绝了

奚梦瑶陪婆婆逛街太乖巧!穿白外套比何猷君高半头,四太这双腿绝了

时间巡查
2026-10-02 03:12:33
杭州降39%、广州降32%、上海降31%!不是房子卖光了, 是房东不卖

杭州降39%、广州降32%、上海降31%!不是房子卖光了, 是房东不卖

白米饭怎么吃
2026-09-30 12:59:30
发现一个奇怪的现象:你吼了孩子,孩子敢顶嘴,说明你这个家庭还有救;如果你不停对孩子吼叫谩骂,孩子一声不吭沉默寡言,那你家庭没救了

发现一个奇怪的现象:你吼了孩子,孩子敢顶嘴,说明你这个家庭还有救;如果你不停对孩子吼叫谩骂,孩子一声不吭沉默寡言,那你家庭没救了

阿呆爸
2026-09-27 21:04:44
演员闫妮坦言自己一直单身:不介意相亲,“有人给我介绍50多岁男子,我说太老了吧,忘了自己也50多”,透露与前夫仍是朋友,还一起打掼蛋

演员闫妮坦言自己一直单身:不介意相亲,“有人给我介绍50多岁男子,我说太老了吧,忘了自己也50多”,透露与前夫仍是朋友,还一起打掼蛋

极目新闻
2026-10-01 08:54:25
耐克宣布重组:业务调整为三大区域市场,中国市场与亚太市场合并

耐克宣布重组:业务调整为三大区域市场,中国市场与亚太市场合并

澎湃新闻
2026-10-02 08:52:26
从“反对”到“打击”:“台独”分裂势力必须读懂这一信号

从“反对”到“打击”:“台独”分裂势力必须读懂这一信号

海峡导报社
2026-10-01 15:10:23
“我能击败任何人” 郑钦文国庆当天2-1险胜世界第231 提奖金24万元

“我能击败任何人” 郑钦文国庆当天2-1险胜世界第231 提奖金24万元

风过乡
2026-10-01 15:01:00
2026-10-02 09:28:49
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
10040文章数 569关注度
往期回顾 全部

科技要闻

“分手”15天后,华为与赛力斯签约新五年

头条要闻

有关伊朗制裁问题 中国在联大投下反对票

头条要闻

有关伊朗制裁问题 中国在联大投下反对票

体育要闻

“今天的表现,我们可以昂首离开球场”

娱乐要闻

奚梦瑶晒四太豪礼!22只龙凤镯近300万

财经要闻

智谱发上亿Token 能挽回开发者信任吗?

汽车要闻

2027款极氪001将于明年一季度上市 现款猎装同步推新配色

态度原创

艺术
房产
数码
公开课
军事航空

艺术要闻

第四届中国美术奖铜奖获得者——李卓

房产要闻

4000+/平!华侨城,直接把海口楼市的地板给掀了!

数码要闻

8月扫地机器人均价创年内低点!石头科技线上销额登顶

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

美防长宣布组建“自主作战司令部”

无障碍浏览 进入关怀版