这项由浙江大学、字节跳动和上海人工智能实验室联合完成的研究,以预印本形式发表于2026年8月4日,论文编号为arXiv:2608.03632,有兴趣深入了解的读者可通过该编号查询完整论文。
在人工智能的世界里,有一种常见的做法叫做"知识蒸馏"——简单说,就是让一个小型AI模型向一个更强大的大型AI模型学习,就像学徒向师傅取经一样。听起来合情合理,但研究团队发现了一个一直被忽视的隐患:师傅有时候会给出一些看似有道理、实则毫无营养的"假教诲",而学徒却毫不知情地照单全收。为了解决这个问题,研究团队提出了一套名为SA-OPD(Spurious-Signal-Aware On-Policy Distillation,即"伪信号感知的在策略蒸馏")的新框架,让学徒AI能够主动识别并过滤掉师傅那些不靠谱的指导,从而真正学到有用的东西。
一、师傅也会说错话:知识蒸馏中的隐藏危机
以一个厨艺学校为背景来理解这件事会更直观一些。学校里有一位经验丰富的大厨(相当于大型AI模型,也叫"教师模型"),还有一位刚入门的学徒(相当于小型AI模型,也叫"学生模型")。传统的学习方式是:学徒做完一道菜,大厨逐步品尝,并对每一个烹饪动作给出详细反馈。这种逐步反馈的方式,在AI领域被称为"在策略蒸馏"(On-Policy Distillation,简称OPD),它的优势在于:学徒做的菜是自己真实发挥的成果,而不是别人示范的标准菜,所以大厨的反馈更贴合学徒目前的实际水平。
然而问题在于:大厨本身也是被训练出来的,他的很多判断并非来自对眼前这道菜的细致品鉴,而是来自他多年积累的"刻板印象"。比如,他看到学徒加了一勺盐,不是真正去尝味道,而是根据过去的经验直接判断"这道菜应该加这么多盐"。更严重的情况是,他可能因为学徒的手法不符合自己习惯的风格,就直接给出负面评价,哪怕学徒的做法实际上并没有问题。
这类反馈——看起来郑重其事、数值上影响巨大,但实际上与眼前的具体食材和菜肴毫无关系——就是研究团队所说的"伪信号"(spurious signals)。这些伪信号在AI训练中会产生很大的梯度(可以理解为"很强的学习冲动"),但方向却是错的,会让学生模型朝着与任务无关的方向越走越偏。
更糟糕的是,传统的方法根本发现不了这个问题。过去研究者通常用"教师模型有多确定"、"师生之间分歧有多大"、"这个反馈学徒学得会吗"等维度来判断哪些教学信号值得重视,但这些维度都没有问一个最根本的问题:这条反馈,真的是针对眼前这道菜给出的吗?还是大厨其实根本没仔细看,只是在套用惯例?
二、侦破"假反馈":用一个巧妙的对比实验揭穿真相
研究团队的核心思路可以用一个生动的对比实验来理解。他们让教师模型在两种情况下分别对同一段学生输出给出评分:第一种是正常情况,教师模型看到完整的题目和学生的回答;第二种是"蒙眼"情况,题目被移除,教师模型只看学生的回答,看不到任何问题或图片。
如果大厨对同一道菜的评价,在"看到了食材"和"没有看到食材"两种情况下几乎一样,那就说明他的评价根本没有参考食材——这条反馈是凭直觉或习惯给出的,与具体任务无关,属于伪信号。反之,如果两种情况下的评价差异很大,就说明大厨确实是针对眼前的具体食材作出判断的,这条反馈是真实可信的。
在技术层面,研究团队把这个"有无题目的评分差异"叫做"输入接地差距"(Input-Grounding Gap,简写为ΔIG)。对于每一个生成的词(在AI中称为"token"),他们会计算出两个数值:一个是有题目时师生之间的分歧程度(Afull),另一个是去掉题目后师生之间的分歧程度(Ares)。两者的差的绝对值越大,说明这条反馈越是基于具体题目的真实判断;差值越小,说明这条反馈越可能是惯例驱动的伪信号。
但仅仅找出"不够接地"的反馈还不够。研究团队进一步指出,一个真正有害的伪信号需要同时满足两个条件:其一,它的接地性低,也就是去不去掉题目对评分影响不大;其二,它的影响力大,也就是这条反馈本身对学生模型的参数更新具有很大的推动力。一条接地性低但影响力也很小的反馈,危害并不大;真正危险的,是那些接地性低但影响力极大的信号——它们会以强劲的力量把学生模型往错误方向推。
SA-OPD的过滤逻辑就建立在这两个条件的交集上:只有同时满足"接地性低"和"影响力大"的词,才会被从训练中移除。这样既避免了误杀有用的信号,又精准打击了最危险的伪信号。
三、数学之美:伪信号为什么真的有害
研究团队不仅在直觉层面描述了伪信号的危害,还做了严格的数学推导,用于解释为什么这类信号会损害训练效果。
可以把AI模型的学习过程类比成在一个山地地形中寻找最低点(最低点代表最优的模型参数)。每次训练时,模型都会沿着某个方向走一步,这个方向就是"梯度"。一个好的梯度方向,应该是朝着真正的最低点走的;而一个坏的梯度方向,可能大步往旁边走,让模型在错误的位置乱转圈。
研究团队证明了一个定理:来自伪信号的梯度(即由语言习惯或模板偏好驱动的更新方向),与真正改善任务表现的梯度方向几乎不相关——用数学语言说,它们的期望内积接近于零。换句话说,这些伪信号的更新方向几乎是随机的,不指向任何有意义的改进,但它们的强度(也就是步子的大小)却可能非常大。这就好比有人每天都拼命向东走几十步,但东方根本不是目的地——力气白费不说,还越走越偏。
进一步地,他们还证明了:即便伪信号的平均方向是零(也就是说,平均下来既不向东也不向西),只要这些信号的能量足够大,经过多次训练积累下来,模型参数的偏移量也会随训练步骤的增加而线性增长。这意味着持续的伪信号会让模型慢慢漂离正确轨道,即使每一步看起来都不那么离谱,长期积累的效果却可能相当严重。这一现象被称为"参数漂移"(parameter drift)。
四、动态平衡:既要过滤伪信号,又不能矫枉过正
在实际操作中,研究团队遇到了一个工程难题:如果过滤的力度太强,把太多词都移除掉,那么有用的教学信号也会被误伤,反而弱化了学习效果。这个问题在视觉理解任务中尤为突出,因为那类任务中伪信号的比例本来就比较高,如果不加限制地过滤,很容易把真正有价值的视觉感知信息也一并删掉。
为了解决这个问题,研究团队设计了一套动态调节机制,叫做"过滤损失质量比"(Filtered Loss-Mass Ratio,简称FLMR)约束。这个机制的工作方式类似于一个安全阀:系统会实时监控被过滤掉的词所占的"学习权重"比例,确保这个比例不超过一个设定的上限(用β表示)。如果过滤比例过高,系统会自动放宽过滤标准,减少被移除的词;如果过滤比例过低,也可以适当收紧标准,确保真正的伪信号能被有效清除。
在视觉理解任务中,研究团队将β设为1.8%,即每次训练时,被过滤掉的词的学习权重最多占总权重的1.8%。实验结果表明,在β不过低的情况下,这种动态调节机制能够稳定地提升性能。当β设为1.8时,相关任务的计数题得分从30.8分提升至33.6分,效果相当显著。
五、实验验证:从数学题到看图题,SA-OPD表现全面领先
研究团队在两大类任务上对SA-OPD进行了系统性测试。一类是纯文本的数学推理任务,另一类是需要同时理解图像和文字的视觉语言模型(VLM)任务。
在数学推理方向,研究团队使用了Qwen3-4B-Instruct作为教师模型,Qwen3-1.7B作为学生模型,在一个包含约7000道数学题的数据集上进行训练,随后在五个基准测试上评估效果,涵盖从高中难度的Math500到竞赛级别的AIME系列和MinervaMATH。结果显示,标准蒸馏方法的平均得分为28.5分,而SA-OPD将其提升至30.4分,同时在每一个单项测试上都达到了最好或并列最好的成绩。尤其是在Math500这个测试上,SA-OPD比之前最强的竞争方法高出了整整3分,差距相当明显。
在视觉语言模型方向,研究团队使用了更大的Qwen3.5-35B-A3B作为教师模型,Qwen3.5-2B作为学生模型,在涵盖图表理解、指令跟随、计数搜索、数学视觉推理、几何题解答等多个维度的六个基准测试上进行评估。在视觉理解方向,标准蒸馏的平均分为50.5,SA-OPD提升至54.0;在视觉推理方向,标准蒸馏为60.4,SA-OPD提升至63.5。计数题(CountQA)的提升尤其突出,比最强竞争方法高出2.8分;几何题(Geo3K)高出2.2分;数学视觉题(MathVision)高出1.2分。
研究团队还用不同规模的师生组合验证了SA-OPD的稳定性,包括用DeepSeek-R1-0528-Qwen3-8B作为教师蒸馏Qwen3-1.7B,以及用Qwen3.5-9B蒸馏Qwen3.5-2B等组合。在所有规模的实验中,SA-OPD都稳定地优于标准蒸馏方法,说明这套机制并不依赖特定的模型大小或能力差距,具有较强的普适性。
六、拆解对比:每个设计细节都有其存在的理由
为了验证SA-OPD各个组成部分的必要性,研究团队做了一系列"拆分实验",每次只去掉或替换某一个设计,看看性能会怎么变化。
随机过滤(即随机去掉相同比例的词)在Geo3K上有轻微提升,但在MathVista上却反而比标准蒸馏更差,说明随机去掉信号是有风险的,不能保证方向正确。单纯按"师生分歧大小"来过滤(只看影响力,不看接地性)会有一定提升,但不如SA-OPD,因为分歧大的词中可能有很多是有价值的纠错信号,不应该被过滤掉。单纯按"接地性低"来过滤(只看接地性,不看影响力)在MathVista上效果不错,但整体上仍逊于SA-OPD,因为有些接地性低的词影响力本来就很小,过滤它们意义不大。
研究团队还测试了一种替代方案:把输入接地差距中"学生模型打分变化"的部分替换成"教师模型置信度",即用教师模型的确信程度来代替师生差异变化。结果这种替代方案比单条件过滤更好,但依然不如原版SA-OPD,说明教师置信度并不是衡量OPD更新信号的最准确指标,而师生之间的实际分歧变化才是更直接的信号来源。
七、视觉任务中的伪信号为什么更顽固
研究团队还做了一项有意思的分析,比较了数学推理任务和视觉任务在训练过程中的伪信号动态。
在数学推理任务中,伪信号主要集中在训练初期:一开始师生之间差距很大,伪信号也比较活跃;但随着学生模型快速适应教师风格,伪信号很快消散,FLMR值迅速跌至接近零。可以把这个过程理解为:刚入职的新员工在最初几天会接收到大量泛泛的指导,但很快就上手了,之后的指导就越来越具体、越来越有针对性。
视觉任务的情况则截然不同。在整个训练过程中,伪信号始终保持在一个非零的水平,没有随着训练的推进而消失。这是因为视觉教师模型需要同时处理图像内容的理解、感知的不确定性和语言表达的习惯,使得它的逐词判断更容易受到"看起来合理但其实与具体图像无关"的固有偏好影响。这也解释了为什么SA-OPD在视觉任务上带来的提升比数学任务更大——视觉OPD的训练梯度持续性地受到伪信号干扰,过滤掉这些信号的效果自然也更加显著。
研究团队还对SA-OPD实际过滤掉的词进行了分析。从500个样本中统计来看,被过滤的词中内容词占了近七成(69.9%),标点和格式词占约两成(20.7%),功能词和数字各占小部分。这说明SA-OPD过滤的不只是无意义的格式符号,而是那些在当前语境下高度可预测、与图像无关的内容词,比如频繁重复出现的词、在上下文中已经高度确定的搭配词等。
此外,从信息熵的角度看,被过滤的词并不集中在高熵(即高不确定性)区域,而是有相当一部分属于低熵但高影响力的词——也就是说,有些词虽然AI很确定该怎么生成,但这种确定性来自语言习惯而非题目内容,这类词如果产生了大的梯度,反而是危险的。这一发现说明单纯依靠熵来识别伪信号是不够的,SA-OPD显式测量输入接地性的做法填补了这一空白。
八、实现细节与计算成本
SA-OPD在工程实现上没有引入任何新的可训练参数,也不需要额外的反向传播步骤。它的额外计算成本仅来自一次额外的"去掉题目后的师生打分"计算,即对同一段学生回答在移除题目后重新计算一遍教师和学生的概率。这相当于在原有流程上多跑了一遍"蒙眼评分"。
实测数据显示,SA-OPD在数学推理任务上的额外时间成本约为6.74%,在视觉理解任务上约为7.53%,在视觉推理任务上最低,仅为2.64%。整个训练过程在8块NVIDIA H20 GPU上进行,数学推理训练约160步,视觉理解约700步,视觉推理约270步。以付出不到8%的时间换取持续稳定的性能提升,这个代价在实际应用中是完全可以接受的。
说到底,这项研究揭示的是一个在AI训练中长期被忽视的盲点:我们一直假设只要教师模型给出的信号"足够强"、"足够有把握",就值得学习,却没有追问这些信号是否真的基于眼前的具体任务。浙江大学、字节跳动和上海人工智能实验室的这支团队通过一个直觉上非常朴素的对比实验——"拿掉题目看评分会不会变"——成功识别并过滤掉了那些"看似权威实则照本宣科"的伪信号,让学生模型真正学到了针对任务的有效知识。
这项发现对普通人的意义,在于它会影响未来每一个基于知识蒸馏技术压缩出来的小型AI模型的质量。手机上的本地AI助手、教育类AI应用、医疗问答工具——这些产品的背后,往往都有知识蒸馏的身影。如果这类技术中的伪信号问题得到更系统的关注和解决,普通用户日常使用的AI产品将能在更小的计算资源下提供更准确、更可靠的输出。
一个值得继续思考的问题是:既然教师模型在语言类任务中会产生伪信号,那在其他类型的AI训练场景中,比如代码生成、医学影像分析、法律文书理解,是否也存在类似的"照本宣科式反馈"?这些领域的伪信号又有哪些独特的形态?有兴趣深入探索这一方向的读者,可以通过arXiv编号2608.03632查阅完整论文,其中附录部分还包含了详细的理论证明和更多可视化示例。
Q&A
Q1:SA-OPD框架中的"伪信号"是什么意思?
A:伪信号是指教师模型给出的看起来有影响力、但实际上与当前任务输入无关的评价。去掉题目后,教师对同一段回答的打分几乎不变,就说明这条反馈是靠语言习惯或模板惯例给出的,而非真正基于题目内容。SA-OPD通过比较有无题目时的师生打分差异,识别并过滤掉这类信号。
Q2:SA-OPD和普通知识蒸馏方法相比,训练时间会增加多少?
A:额外成本非常有限。实测数据显示,在8块H20 GPU上,数学推理任务多耗时约6.74%,视觉理解任务多耗时约7.53%,视觉推理任务仅多2.64%。SA-OPD不引入任何新的可训练参数,额外计算来自对同一段学生回答进行一次去掉题目后的师生重新打分。
Q3:SA-OPD方法在视觉任务上提升更大,原因是什么?
A:因为视觉教师模型需要同时处理图像内容、感知不确定性和语言习惯,导致其逐词判断更容易受到与图像无关的固有偏好干扰,且这种干扰在整个训练过程中持续存在。而数学推理任务中的伪信号主要集中在训练初期,之后会快速消散。因此过滤伪信号对视觉任务的帮助更持久、幅度更大。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.