网易首页 > 网易号 > 正文 申请入驻

小红书与中科院突破:反向学习法实现AI数学推理能力提升11.5分

0
分享至

来源:市场资讯

(来源:科技行者)


这项由小红书技术团队与中国科学院自动化研究所联合开展的研究,以预印本形式发布于2026年5月,论文编号为arXiv:2605.11609。感兴趣的读者可通过该编号在arXiv平台查阅完整原文。

当你辅导一个孩子解数学题时,你可能遇到过这样的困境:如果你提前把答案告诉他,他往往只会机械地套用你给出的那条路径,完全不愿意自己动脑筋探索其他解法。这种情况下,告诉他答案反而害了他——因为他失去了独立思考的机会。现如今,AI在学习数学的时候,也掉进了完全相同的陷阱。

研究团队发现,当前一种流行的AI训练方法叫做"自蒸馏"(self-distillation),其思路听起来很聪明:让AI自己既当学生又当老师,给老师版本看正确答案,然后让学生版本向老师学习。然而在数学推理这个领域,这种方法在多个主流AI模型上几乎全军覆没,表现甚至比不用这种方法的基线还差。这是为什么?又该怎么修?

研究团队提出了一个反直觉的解决方案:既然向老师学习会有问题,那就反着来——主动远离老师的做法。这套方法被命名为"反自蒸馏"(Anti-Self-Distillation,简称AntiSD)。在五个规模从40亿到300亿参数不等的AI模型上,AntiSD不仅让模型以快2到10倍的速度达到原先的训练效果,最终准确率更是最多提升了11.5个百分点。

一、老师知道答案,反而害了学生

要理解这个问题的根源,先从"自蒸馏"的工作原理说起。在标准的强化学习训练中,AI会不断尝试解题,每次答对就得一分,答错就不得分。这种方式就像给孩子做判断题——只知道对错,不知道哪一步做错了,学习效率很低。

自蒸馏的出现正是为了解决这个问题。它的做法是:拿同一个AI模型扮演两个角色——"学生版本"正常解题,"老师版本"则在看过正确答案之后,对学生写的每一个字词重新打分。学生版本再向老师版本学习,从而获得比单纯对错反馈更细致的指导信号。

听起来很合理,对吧?但研究团队发现了一个致命的结构性缺陷。他们分析了老师版本对每一个词的态度,结果发现了一个清晰的两极分化模式。

当老师版本看过正确答案之后,它对某些词语会变得极度自信——比如"因此"、"代入"、"成立"这类词,因为它已经知道推导方向是对的,这些词在正确推导中自然而然就会出现。研究团队把这类词称为"走捷径的词"。与此同时,老师版本对另一类词则变得特别排斥——比如"等等"(Wait)、"或许"(Maybe)、"换个角度"(Alternatively)。这些词代表着重新审视问题、探索多种可能的思维过程。但老师版本已经知道正确答案了,自然觉得这些"犹豫的词"没有必要。

于是标准自蒸馏的实际效果变成了:让AI学会避开探索性思维,直奔它认为正确的路径。这在数学上是灾难性的,因为复杂数学题恰恰需要大量的"等等,让我换个思路试试"。这也解释了为什么研究者们普遍观察到一个现象:用自蒸馏训练的AI,回答会越来越短——不是因为它变聪明了,而是因为它被训练成了不再探索。

研究团队用一个信息论工具——逐点互信息(Pointwise Mutual Information,PMI)——严格证明了这个分析。简单来说,这个工具衡量的是"知道了答案之后,某个词出现的概率是升高了还是降低了"。升高的词就是"走捷径的词",降低的词就是"探索性的词"。标准自蒸馏奖励前者、惩罚后者,方向完全错了。

二、反着学:远离老师,反而找到自己的路

找到了问题所在,修复思路就直接了当:既然老师的信号方向错了,那就反过来用。

标准自蒸馏是让学生往老师靠近,AntiSD则是让学生主动往老师的反方向走。用数学语言表达就是:原来是"最小化学生和老师之间的差异",现在变成了"最大化学生和老师之间的差异"。这一字之差,让每个词的信号方向全部翻转——原来被奖励的"走捷径的词"现在受到压制,原来被惩罚的"探索性词语"现在得到鼓励。

这有点像考试备考时的一个反常策略:与其死记老师给的标准答案,不如刻意练习那些老师没有强调、但自己容易想不到的解题路径。

不过,单纯反向学习会带来一个新问题:没有一个天然的"停止时机"。原来向老师靠近是有终点的——靠得足够近就停了。但反向远离不一样,理论上可以一直远下去直到出问题。为此,研究团队引入了两个附加设计。

第一个是选择更合适的"差异度量方式"。研究团队选择了詹森-香农散度(Jensen-Shannon Divergence,JSD),而非另一种常见的KL散度。这里有个重要的工程考量:在实际训练数据中,"探索性词语"出现的频率比"走捷径的词语"更高,而且有些极端情况下的信号值会达到负20以下,非常夸张。JSD的数学特性能自动给探索性词语那一侧的信号设置一个上限(约为0.347),避免极端值主导整个训练过程。走捷径那一侧则没有上限,确保极端的走捷径行为受到强力压制。

第二个是"熵触发开关"。当老师版本自己也变得过度自信——比如它已经完全收敛到某个固定模式,每个词都确定无疑——这时候老师和学生之间的差异信号就不再有信息价值,都是噪音了。研究团队设计了一个自动监控机制,持续追踪老师版本每个词位置上的"不确定程度"(用信息熵衡量)。一旦这个不确定程度跌破某个阈值,就把反自蒸馏的训练信号关掉;等老师的不确定程度恢复正常,再重新开启。这种设计参考了电子电路中的"施密特触发器"原理,能有效避免在临界点附近反复开关抖动。

整个方法的实现非常轻量。只需要在原有的训练流程中,多做一次带有正确答案的前向推理(forward pass),用来计算老师版本对每个词的概率,然后根据公式算出每个词的权重,加到原有的训练信号里就行了。没有额外的模型,没有额外的数据,计算开销几乎可以忽略。

三、实验结果:效率和准确率双双飙升

研究团队在五个主流开源AI模型上进行了完整测试,涵盖Qwen3-8B、Qwen3-4B-IT-2507、Olmo3-7B-IT、Olmo3-7B-TK和Qwen3-30B-A3B,参数规模从40亿到300亿不等。训练数据使用了DAPO-Math-17k这个数学题数据集,共训练200步。评估则在AIME 2024、2025、2026(美国数学邀请赛)、HMMT 2025(哈佛-MIT数学竞赛)和MinervaMath五个基准上进行。

结果非常一致地呈现出三个规律。

第一个规律是"点火速度"大幅提升。AntiSD从训练第一步就能提供有意义的逐词信号,不需要等待稀疏的对错反馈慢慢累积。在Qwen3-4B-IT-2507这个模型上,AntiSD仅用大约30步就达到了标准GRPO训练需要150步才能达到的训练奖励水平。换算成倍数,AntiSD在不同模型上达到GRPO基线准确率的速度是后者的2到10倍。对于研究者来说,训练成本大幅下降意味着可以用同样的算力探索更多方向。

第二个规律是"最终准确率"全面提升。在所有五个模型上,AntiSD的最终平均准确率都超过了标准GRPO。提升幅度从最小的2.1个百分点(Olmo3-7B-TK,这个模型的基线本来就已经很强)到最大的11.5个百分点(Qwen3-8B)。在最难的HMMT 2025竞赛题上,Qwen3-8B的得分从39.2%提升到了54.4%,提升幅度达到15个百分点。

为了验证提升不是靠"押宝"少数几道题来的,研究团队还测试了pass@k指标,也就是用32次机会来回答同一道题,看能解出多少道题。AntiSD在32次机会的宽松条件下依然领先GRPO大约7到10个百分点,说明它确实解锁了GRPO根本无法解决的题目,而不是靠减少随机性来凑分。

第三个规律是"标准自蒸馏全面崩溃"。在所有五个模型上,使用正向自蒸馏的结果都比不用自蒸馏的基线差,有时差距惊人——Qwen3-8B上,标准自蒸馏的平均分是30.6,而不用的是57.4,差了将近27个百分点。这证实了之前理论分析的预测:把有答案的老师的信号方向用错了。

研究团队还做了一个有意思的延伸实验:在代码编写任务上,AntiSD同样让Qwen3-8B在HumanEval+上提升1.2个百分点、在MBPP+上提升2.3个百分点。虽然提升幅度没有数学任务那么大,但方向完全一致,说明这个方法的有效性不局限于数学。

四、拆解每个零件,哪个最重要

为了搞清楚到底是哪个设计起了关键作用,研究团队做了详细的消融实验——也就是一次只改变一个设计选择,看效果如何变化。

其中有一个实验最能说明问题:如果把老师的正确答案信息完全去掉,只让模型基于自己的概率来反向学习,会怎样?结果是三个模型无一例外地在大约70步内彻底崩溃——训练奖励归零,回答越来越长直到超出上限,模型进入无法恢复的死循环。这清楚地说明,AntiSD有效的关键不是"反向学习"这个动作本身,而是"以老师和学生之间的差异"作为信号来反向学习。去掉老师的正确答案,信号就没有了依托,反而会放大模型原本的任何偏向,形成正反馈崩溃。

另一个有趣的发现是关于熵触发开关的。在Qwen3系列模型上,去掉开关后,模型确实先跑得更快——在大约40步时就达到了0.97的训练奖励——但随即在90步左右因为老师版本过度自信而崩溃。而在Olmo3-7B-IT模型上,同样去掉开关,却能撑过全程200步而不出问题。差异来自于这两类模型的初始信息熵水平:Qwen3模型起步时每个词的不确定程度大约是0.4纳特,距离"完全确定"的临界点不远;Olmo3模型起步更高,有足够的余量不需要开关保护。这说明开关起到的是"跨模型保险"的作用,而非针对某个特定模型调整的参数。

在具体的数学形式选择上,研究团队比较了JSD和KL散度的反向版本。结果显示,用KL散度的反向版本在Qwen3-4B-IT-2507上直接失败了,平均分只有49.5,不仅没有超过GRPO基线,甚至在整个训练过程中都无法稳定提升。这验证了之前的分析:KL散度在探索性词语那一侧没有上限,极端信号值过大,导致训练不稳定。

此外,研究团队还测试了"加性合并"和"乘性合并"两种方式把AntiSD的信号加入原有训练信号中。加性方式效果更好,理由也很直觉化:在对错信号很弱的情况下——比如模型面对一道极难的题,几乎所有尝试都失败了——乘性方式会把AntiSD的信号一起缩小到接近零,恰恰在最需要探索性引导的时候失去了它的作用。加性方式则不受此影响,始终保持独立的贡献。

研究团队还验证了一个实用场景:能不能在一个已经用标准方法训练饱和的模型上,再叠加AntiSD?他们从Qwen3-8B的标准训练终点重新出发,只再跑50步AntiSD,结果在30步内就基本追上了从零开始训练AntiSD整整200步的效果。这说明AntiSD的信号对已经很强的模型依然有价值——它照亮的是那些靠对错反馈永远无法抵达的角落。

五、为什么这件事比看起来更重要

从技术上来讲,AntiSD实际上提供了一个不需要人工标注、不需要额外模型的"逐步奖励信号"。研究团队在论文中证明了,把每一步的信号加总起来,恰好等于"在知道正确答案之后,对整个回答的综合评价"。这意味着这个逐步信号在理论上不会改变最优策略的集合,只是帮助更快、更准确地找到那些最优策略。

更深层的意义在于,这项研究从一个实验失败开始——自蒸馏在数学上不管用——然后通过精确的理论分析找到了失败的根源,再针对根源设计了一个最小改动的修复方案。整个过程是标准的科学推进路径,而得到的结论出人意料地干净:只需要翻转一个符号,加上一个自动触发的保险,就能让一个普遍失败的方法变成一个系统性成功的方法。

说到底,这项研究揭示的是一个更普遍的道理:在学习复杂推理的时候,知道"应该往哪里走"并不总是好事,有时候反而需要保护那些"还不确定要往哪里走"的时刻。探索本身就是价值的来源,而任何会压制探索的训练信号,都可能在无意间把模型训练成了一个只会背捷径的优等生,而不是真正会思考的问题解决者。

当前研究的评估范围主要集中在数学推理,以及一个初步的代码任务测试。研究团队也坦诚,AntiSD的理论分析描述的是每一步的局部信号特性,而非整个训练过程的全局收敛保证。多轮对话、更大规模的模型,以及更丰富的特权信息形式,都是值得继续探索的方向。有兴趣深入了解具体数学推导和实验细节的读者,可以通过arXiv:2605.11609查阅完整论文。

Q&A

Q1:AntiSD的"反自蒸馏"为什么反向学习老师反而会更好?

A:标准自蒸馏让AI向看过答案的老师靠近,但老师知道答案后会偏爱"结论性词汇"、压制"探索性词汇",导致AI越来越不会独立探索。AntiSD把这个信号方向翻转,主动压制"走捷径词汇"、鼓励"探索性词汇",反而帮助AI保留了解复杂题目所需的多路径搜索能力。

Q2:AntiSD训练速度快2到10倍,意味着什么?

A:意味着同样的算力和时间可以训练出更强的模型,或者用更少的资源达到原来的效果。对于需要大量迭代的AI研究团队来说,这种效率提升直接降低了训练成本,也让更快速地探索不同方案成为可能。

Q3:AntiSD方法是否可以用在已经训练好的AI模型上继续提升?

A:可以。研究团队验证了在一个已经用标准方法训练到饱和的Qwen3-8B模型上,只需额外运行30步AntiSD,就基本追上了从头训练AntiSD整整180步的效果。说明这个方法可以作为"增强补丁"叠加在现有模型上,而不必从零开始重新训练。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
施罗德回应被交易:米切尔哈登大量单打 我想要融入骑士十分艰难

施罗德回应被交易:米切尔哈登大量单打 我想要融入骑士十分艰难

罗说NBA
2026-08-18 06:36:21
制止家暴反被判故意伤害?当事人:只求一个公道

制止家暴反被判故意伤害?当事人:只求一个公道

看看新闻Knews
2026-08-17 17:21:14
体面退场!巴斯家族出售湖人剩余股份:珍妮不再担任球队管理者

体面退场!巴斯家族出售湖人剩余股份:珍妮不再担任球队管理者

罗说NBA
2026-08-18 06:01:25
女法官又放名言:你老婆死在别人床上你就完全没有责任吗

女法官又放名言:你老婆死在别人床上你就完全没有责任吗

大国老记老顾
2026-08-17 15:31:52
“中式恐怖”,现在大家为啥开始抵触了?网友:没有对比就没有伤害!

“中式恐怖”,现在大家为啥开始抵触了?网友:没有对比就没有伤害!

另子维爱读史
2026-08-17 21:10:20
伟伟道来 | 强撑颜面:美国派出第三艘航母,伊朗威胁升级冲突

伟伟道来 | 强撑颜面:美国派出第三艘航母,伊朗威胁升级冲突

经济观察报
2026-08-17 16:48:08
我们没能阻止朝鲜拥核,没能阻止萨德入韩,没能阻止台积电赴美设厂,没能阻止菲律宾南海占岛,甚至也可能阻止不了日本拥核!

我们没能阻止朝鲜拥核,没能阻止萨德入韩,没能阻止台积电赴美设厂,没能阻止菲律宾南海占岛,甚至也可能阻止不了日本拥核!

扶苏聊历史
2026-08-17 12:20:07
炸裂!日本妻子拍AV挽救婚姻,瞒夫出道老公崩溃,如今丈夫成粉丝

炸裂!日本妻子拍AV挽救婚姻,瞒夫出道老公崩溃,如今丈夫成粉丝

悠悠说世界
2026-08-17 13:48:27
A股:国务院高层重磅发声,释放强烈信号!周二A股将迎来新的行情

A股:国务院高层重磅发声,释放强烈信号!周二A股将迎来新的行情

虎哥闲聊
2026-08-18 00:00:04
杭州的另一面

杭州的另一面

大嘴説
2026-08-17 14:42:08
高市早苗:每天只睡0-3个小时 下班还要打扫浴室、洗衣服

高市早苗:每天只睡0-3个小时 下班还要打扫浴室、洗衣服

互联网大观
2026-08-17 15:16:34
刚坐完C919,实话实说:和波音、空客的差距,根本不是你想的那样

刚坐完C919,实话实说:和波音、空客的差距,根本不是你想的那样

李博世财经
2026-08-17 10:19:10
“男子结婚8年3孩均非亲生”案今日开庭;男方:说出孩子生父可以不要赔偿,自己母亲希望留一个抚养

“男子结婚8年3孩均非亲生”案今日开庭;男方:说出孩子生父可以不要赔偿,自己母亲希望留一个抚养

天涯社区
2026-08-17 18:06:19
比无人机更令美国担忧,中国破解全球难题,先进得不像中国发明

比无人机更令美国担忧,中国破解全球难题,先进得不像中国发明

浯江孤舟
2026-08-17 13:00:33
C罗专访称“这大概是我最后一年踢球”:未来早已规划好,想多旅行、打打板式网球

C罗专访称“这大概是我最后一年踢球”:未来早已规划好,想多旅行、打打板式网球

我是一个养虾人
2026-08-17 05:23:31
《牛来》票房破1000万!层层分账之后,导演信雨萌能到手多少钱?

《牛来》票房破1000万!层层分账之后,导演信雨萌能到手多少钱?

露珠聊影视
2026-08-17 12:20:38
“拿日本兵做活体实验”,日媒罕见曝光日军暴行!

“拿日本兵做活体实验”,日媒罕见曝光日军暴行!

环球时报国际
2026-08-17 15:15:02
大连警察被困“假枪真罪”:从超市买的玩具枪,让警察沦为“罪犯”

大连警察被困“假枪真罪”:从超市买的玩具枪,让警察沦为“罪犯”

塔子山评说
2026-08-17 17:07:28
反转!珍妮并未同意出售湖人股权:未经她许可任何交易均无法生效

反转!珍妮并未同意出售湖人股权:未经她许可任何交易均无法生效

罗说NBA
2026-08-18 06:55:33
看看康生真迹,才知什么叫“眼高于顶”

看看康生真迹,才知什么叫“眼高于顶”

中国艺术家
2026-08-17 05:24:34
2026-08-18 07:23:00
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4452801文章数 9312关注度
往期回顾 全部

科技要闻

马斯克600亿美元买条近路

头条要闻

因老板娘一句随口交代 打工走失男子独守深山老宅25年

头条要闻

因老板娘一句随口交代 打工走失男子独守深山老宅25年

体育要闻

C罗:可能是生涯最后一年 未来都规划好了

娱乐要闻

立案风波席卷德云社多场巡演叫停!

财经要闻

爱丽家居跨界玩存储:溢价背后藏着机密案

汽车要闻

2027款艾瑞泽8 PRO 年轻人的务实之选

态度原创

本地
家居
时尚
手机
公开课

本地新闻

黄景藏用半刀泥刻瓷都魂

家居要闻

2026建博会(广州) 公装联探展交流活动

夏天裤子不要总穿黑色,试试粉色阔腿长裤,舒适显瘦又有个性

手机要闻

ColorOS 16这波更新太狠了!桌面小红点一秒清零,330城交通卡免费用,隐私保护还升级了

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版