![]()
2026年初,两个研究团队几乎在同一周,各自独立地发表了一个听起来有点反直觉的想法:让一个语言模型当自己的老师。
不是找一个更大、更聪明的模型来指导它,而是让它用同一份权重,看着标准答案,去给自己打分。这两篇论文一篇叫OPSD(On-Policy Self-Distillation,在线策略自蒸馏),一篇叫SDPO(Self-Distillation Policy Optimization,自蒸馏策略优化),后来被合称为“在线策略自蒸馏”这条技术路线。
这事听起来有点像左手打右手。但结果出乎意料地好:在数学推理任务上,它用的生成词元数量只有强化学习方法的一个零头,效果却能打平甚至超过后者。
问题是,好景不长。半年过去,越来越多后续论文指向同一个症状:模型越训练,脑子越“死板”。这篇文章要讲的,就是这个症状背后到底发生了什么,以及研究者们找到的三个调节旋钮。
先搞懂:为什么要发明这个方法
要理解OPSD为什么会出现,得先看看它之前的方法都卡在哪儿。
最早的做法是监督微调(SFT)
*SFT:Supervised Fine-Tuning,用人类写好的标准答案,让模型逐字逐句模仿着学*
这个方法的问题在于,模型学的是别人写的答案,而不是自己写出来的东西。打个比方,这就像让一个学生反复抄写标准答案,抄得滚瓜烂熟,可一旦到了考场上自己动笔,稍微偏离标准套路一步,就慌了神,不知道下一步该写什么。这种“背课文式”学习和“自己做题”之间的落差,学界管它叫暴露偏差:训练时模型总是接着正确的开头往下写,从没体验过写错一步之后该怎么收场。
后来强化学习来了,尤其是带可验证奖励的强化学习(RLVR)
*RLVR:Reinforcement Learning with Verifiable Rewards,只在答案能被自动判定对错的任务(比如数学、编程)上做强化学习*
这套方法解决了暴露偏差问题,因为模型学的是自己生成的内容,而不是别人写的。但它引入了新麻烦:奖励太稀疏了。一道数学题模型要写几百个词元才能得出答案,可最后只有一个“对”或“错”的信号。这就好比你写了一整篇高考作文,阅卷老师却只告诉你“0分”或“满分”,不说你哪句话写得好,哪句话跑题了。模型很难搞清楚这几百个词元里到底是哪几步走错了,这个问题叫做信用分配困难。而且要凑够足够的样本,还得让模型反复生成很多次长长的答案,非常烧算力。
于是在线策略蒸馏(On-Policy Distillation,简称OPD)出现了,思路很直接:找一个更强的老师模型,让它给学生模型自己写的每一个词元打分,这样既保留了“自己生成”这个优点,又把稀疏的终点奖励变成了密集的逐词元反馈。代价是你得养一个更大的老师模型全程陪跑,这笔算力开销不小。
OPSD和SDPO要解决的就是这最后一道坎:能不能不请外部老师,让模型自己当自己的老师?
答案是:可以,只要给这个“老师版本”的自己看一点“作弊小抄”。
老师和学生,其实是同一个人
这里有个关键设定需要先说清楚:OPSD里的老师,能力并不比学生强。
它只是多看了一点东西。这个多看到的东西,论文里叫做特权信息(Privileged Information,简称PI)
*特权信息:只有老师能看到、学生在正式考试(也就是推理阶段)看不到的额外信息,比如标准答案、思路提示,或者环境的反馈*
具体怎么运作?拆开看是这样几步。
首先,学生模型拿到一道题目,自己一个词一个词地把答案写出来,这个过程完全是它自己的真实水平,没有任何外挂。写完之后,把这份答案连同标准答案一起交给“老师”,注意,老师就是同一个模型,只是这次它的输入里多塞了一份标准答案。老师会给学生写的每一个词元打分,告诉它“这个词你选得怎么样”。最后拿老师的判断和学生自己原本的判断做对比,算出一个差距,用这个差距去调整模型的参数,让学生的判断慢慢向老师的判断靠拢。
这个设计的巧妙之处在于,两次打分(老师的、学生的)都是并行完成的,只有学生生成答案那一步是必须一步步来的,后面对比打分可以一次性批量算完,这就是为什么它比反复采样多条长轨迹的强化学习方法要省时间。
打个比方,这有点像考完试之后对答案。你自己写完了卷子,然后拿到一份带解析的标准答案册子,逐题核对哪里想岔了。如果没有这本答案册子,你只能等着老师改完卷子告诉你一个总分,根本不知道具体哪道题的哪一步出了问题。特权信息扮演的就是这本答案册子的角色,它让“对答案”这件事精确到了每一个词元的粒度。
但这里藏着一个致命的选择,也是整篇文章后面要反复回来讨论的核心矛盾:
对答案这件事,如果做得太彻底,会把人教懒。
如果答案册子把每一步的详细解析都写得清清楚楚,甚至直接把最终答案划出来了,学生会怎么做?他可能不会真去理解每一步的逻辑,而是直接对照着答案册子的思路“描红”,考试时遇到没见过的新题型,反而不会自己想办法了。这就是本文要讲的核心症状:坍缩(Collapse)。
*坍缩:模型能想出来的解题思路越来越少,最后可能只会一种套路,遇到变化就懵*
症状:坍缩到底长什么样
坍缩不是一句空话,它有三个可以观察到的层面。
行为层面上,你会发现模型做一道题、只让它试一次的正确率(术语叫pass@1)提高了,但让它试很多次、只要有一次做对就算过(pass@k,k比如取16)的正确率却掉了下来。这说明什么?说明模型变得更“自信”了,但探索能力变差了。它更擅长用同一种套路蒙对题目,却失去了尝试别的路子的能力。有研究者在Qwen3-8B模型上实测:自蒸馏训练之后,pass@1从71.9涨到73.4,看着是进步,但pass@16却从83.6跌到78.5,实实在在的退步。
词元分布层面,模型输出的概率越来越集中在少数几个词元上,用信息论的话说就是熵在下降。
*熵:这里指模型对下一个词该选什么的“犹豫程度”,熵越低说明模型越笃定、选择越单一*
几何层面,针对同一道题,模型原本可能有好几种解法可以选,训练完之后它只认准一种,其他的路径全都被“遗忘”了。
这里有个特别反直觉的发现值得单独拎出来说:熵和多样性其实不是一回事。
同样是那个Qwen3-8B的实验,研究者发现自蒸馏训练出来的模型,它的词元熵反而比强化学习训练出来的模型更高,可它实际能想出来的不同解法数量却更少。这就好比一个人说话看起来犹豫不决、遣词造句很随机,但他脑子里翻来覆去其实只有一个套路。所以只看熵这一个指标是会被骗的,必须去看pass@k这种真正衡量“能不能想出别的办法”的指标。
坍缩的成因分成两类,一类是老问题,另一类是OPSD独有的新问题。
老问题不需要老师、不需要特权信息就会发生。强化学习的梯度更新本身就有个规律:R = -a·e^H + b,意思是模型的表现受限于一个“熵预算”,这个预算会随着训练不断被花光。每次模型因为答对了一道题而调高某个答案的概率,就意味着其他同样正确、但概率稍低的答案被相应压低了。另一个老问题叫模型坍缩(Model Collapse),指的是任何“用模型自己生成的数据去训练自己”的循环,都会先丢掉概率分布里的长尾(那些少见但正确的解法),然后逐渐收敛到一个几乎没有波动的单一模式。这就好比一个乐队反复翻唱自己的老歌,几年下来风格越唱越窄,最后所有歌听起来都差不多。
而OPSD独有的问题,来自特权信息本身,学界给它起了个名字,叫点互信息(PMI)机制
*PMI:Pointwise Mutual Information,这里指老师传递给学生的信号,本质上度量的是“某个词元和标准答案之间的关联强度”*
问题出在哪?当老师已经知道标准答案的时候,它就不再需要犹豫了。它会强烈奖励那些直接指向答案的词元,比如逻辑连接词、可验证的数值,同时惩罚那些“犹豫型”词元,比如“等等”“也许”“让我再想想”。可正是这些犹豫词元,在真实考试(推理阶段)里承担着让模型多路径搜索、反复检验的功能。老师因为看过答案,觉得这些犹豫是浪费时间,就把它们从学生的学习信号里砍掉了,学生也就慢慢丧失了这种自我纠错的能力。
三组研究从不同角度证实了这个机制。有研究把它叫做“认知性表达的抑制”:一个知道答案的老师表达的不确定性更少,学生跟着学,结果在没见过的新任务上表现直接崩盘。另一组研究给这个现象起名“强者愈强”:因为拿去喂给老师的示范答案,往往就是模型自己本来就最擅长的那种解法,结果这种解法被进一步强化,其他本来就少见但正确的解法反而彻底消失了。第三组研究则更精确地定位到,特权信息会降低推理路径的“分叉率”,也就是原本模型在某个节点还能往两三个方向想,现在只剩一条路可走了。
旋钮一:信号该打在哪个词元上
第一个可以调节的旋钮,叫做信号的几何形状,具体拆成两件事:拉近老师和学生分布时用哪个方向的散度,以及这个信号该均匀分布还是有选择地分布。
先说方向的问题。衡量两个概率分布差距的常用工具叫KL散度,它有两个方向可选:正向KL(forward KL)和反向KL(reverse KL)。
*KL散度:一种衡量两个概率分布之间差异大小的数学工具*
*正向KL:促使学生去覆盖老师所有可能的答案模式,学生的分布会变得比较“宽”*
*反向KL:促使学生只挑老师最有把握的那一个模式去学,学生的分布会变得比较“窄”*
想象你在跟一个导游学一座城市的地图。正向KL就像导游把城里所有值得去的地方都指给你看,你脑子里装的是一张“广而全”的地图。反向KL则像导游只带你去他最喜欢的那家餐厅,你去了以后确实很满意,但你对这座城市其他地方一无所知。OPSD的创始论文选择了正向KL,理由是它“持续带来最强的收益”,但后续研究发现事情没这么简单:反向KL确实能让pass@1更高,但会加速多样性坍缩,pass@1涨、pass@k却跌,而且这个问题在陌生任务上会更严重。
第二个问题更有意思:一个词一个词地打分,是不是每个词都该同等重要?
答案是否定的。有研究做了个对比实验,比较蒸馏梯度和一个理想的“逐词元梯度”之间的对齐程度,发现只有大约一半的词元是真正对答对题目有帮助的,如果只在这些“对齐良好”的词元上做蒸馏,信号质量能提升十到十五倍。换句话说,一份答案里,真正决定这道题能不能做对的关键决策点,可能只占很小一部分,剩下的都是格式性、过渡性的内容。如果对所有词元一视同仁地打分,那些无关紧要的“水词”反而会稀释掉真正有用的信号。
有个方法给出了具体做法,叫“熵感知的在线策略蒸馏”:在老师比较确定的低熵词元上,用反向KL让学生精确模仿老师最有把握的答案;但在老师自己也拿不准的高熵词元上,改用正向KL,逼学生把老师认为“都有可能对”的多种续写方式都保留下来,而不是随便选一个就锁死。研究者测出来,高熵词元恰恰是推理分叉、决策最重要的地方,如果处理不好,学生会在这些关键节点上过早地把选项收窄,恰恰是这些节点,学生保留的高熵词元比例只有6.8%,而老师是18.5%,说明学生已经比老师“死板”了不少。
另一个思路来自一种改良版的强化学习方法,做法是训练前先把题目分成两类:模型已经会做的和还不会做的。对已经会做的题目,加一个“回顾复习”式的约束,防止模型学新东西的时候把老本行给忘了;对还不会做的题目,则完全放开手让它自由探索,不加任何约束,因为一个还没学会的技能没什么好“复习”的。
这里其实反映出一个更普遍的道理:密集的监督信号不是越密越好,关键是要选对地方打。这一点后续会反复出现。
旋钮二:到底该给老师看多少料
如果说旋钮一决定了信号打在哪里,旋钮二决定的是老师看到的那份“答案册子”到底该有多详细。
这是整篇综述里分量最重的一个部分,因为它直接对应着一个更古老的机器学习理论:特权信息学习理论,早在2009年就由Vapnik和Vashist提出。这个理论有一条核心规则一直被后来的研究反复验证:特权信息是用来帮助学习的,不是用来被照抄的。
这条规则在机器人学领域已经被验证过很多次了。有一个经典案例叫“作弊式学习”(Learning by Cheating):先训练一个能看到整个场景精确布局的“作弊”智能体来开车,再让一个只能看摄像头画面的普通智能体去模仿它。这个方法之所以能成功,是因为普通智能体能从摄像头画面里,重新推导出作弊智能体当初看到的那些关键信息。
但也有失败的反例。如果作弊智能体依据的是普通智能体压根接触不到的信息做决策,那模仿这件事就会出问题,学界管这个叫“模仿鸿沟”。举个例子,假如作弊智能体知道前方拐角处有个行人(因为它能看穿墙),它会提前减速,可普通智能体的摄像头根本看不到墙后面的行人,它学到的“提前减速”这个动作,在它自己的视角下毫无逻辑,遇到类似但没有行人的场景反而会莫名其妙地减速。
这条安全性标准可以直接搬到OPSD里用:一份特权信息是否安全,取决于学生能不能凭自己在推理时能拿到的信息,把这份特权信息重新推导出来。如果推导不出来,就只能死记硬背,而死记硬背的东西在真实考场上派不上用场。
按这条标准把常见的几种特权信息排个序,从最危险到最安全大致是这样:
最危险的是只给最终答案。学生完全没法推导出这个答案是怎么来的,老师这边也因为已经知道答案,彻底没有犹豫的必要了。有实验显示,只给最终答案训出来的模型,成绩甚至比完全不给任何特权信息还要差,在一个叫C-Eval的测试上跑出59.5分,而不给任何特权信息的基线是63.0分。
其次是完整的标准解法(推理过程加最终答案),这正是OPSD原始论文的选择。它虽然多给了推理过程,但依然完全暴露了答案,所以它并不比“只给答案”安全多少,测试显示在“思考型”模型上会造成最高17%的相对性能下降。
再往下是完整的思维链(Chain of Thought,简称CoT),它展示了推理过程,但不一定明说最后的答案,风险相对低一些。有研究提议只给老师看思维链的前一半,效果反而比给完整的更好。
再往下是解题计划或步骤骨架,只给结构不给具体数值,目标变得更容易被学生自己复现出来。再往下是评分细则(rubric),只列出一份好答案该满足哪些标准,不规定具体走哪条路,这样老师可以覆盖好几种不同的推理路径,多样性能保住。最安全的是错误反馈和“只给动作不给推理”这类局部、有条件的信息。
有两组研究做了直接的对照实验,把这个排序从假说变成了实证结论。
第一组研究比较了三种情境下的自我教学效果:只有对错的二元奖励、标准的参考答案、以及一种“步骤对齐的批注”。这种批注由一个专门的批评模型生成,它会逐字保留学生推理里正确的步骤,只重写出错的那部分,而且是用学生自己的语言风格改写。结果这种“只改错处”的批注方式,效果比给参考答案的方式高出5.27分,比二元奖励高出16.11分。研究者进一步分析发现,如果直接给参考答案,模型会在每一个词元上都调整自己的行为,哪怕那个词元本来就是对的;而只改错处的批注只在真正出错的地方施加影响,信号精准得多。
第二组研究比较了五种不同形式的特权信息,包括最终答案、带执行结果的分步提示、不带执行结果的分步提示、摘要式提示,以及完全不给。结果最终答案的分数(59.5)反而低于完全不给的基线(63.0),而不带执行结果的分步提示分数最高,达到71.3。
这两组实验共同指向一个结论:让特权信息真正有效的,不是它包不包含正确答案,而是它有没有能力传递一种可迁移的“技能”。
有意思的是,还有一个看似无害的选择,其实也藏着陷阱。有研究给老师看的示范答案,是从学生自己以前做对的答案里随机抽取的。听起来很合理对吧,用学生自己成功过的经验来教它。但问题在于,学生做对的题目往往用的是它最熟练、最常用的那种解法,把这种解法当示范反复喂给它,只会让这种解法变得更强势,其他本来就不常出现、但同样正确的解法反而会被彻底挤没。这就是前面提到的“强者愈强”效应,它提醒我们,即便是“正确”的示范,也不代表是“健康”的示范,多样性同样重要。
针对这个泄漏问题,最近的研究已经给出了几种具体补救方案。一种叫“锚定残差引导”,做法是把老师的目标拆成两部分:一部分是只给老师看解题过程的前一半、不给答案时产生的目标,这部分学生能够着;另一部分是完整答案暴露之后多出来的部分,这部分被认为携带了“泄漏”,只保留其中一小部分(比如60%)混进最终目标里。这样处理之后,模型学到不该学的“抄近道”行为下降了超过20%。
另一种方法叫“纯化的自蒸馏”,思路是让一个只看到答案、完全不看题目的老师版本,去反推出哪些信号纯粹是因为“抄了答案”才产生的,然后把这部分信号剔除掉,只保留真正来自“理解了这道题”的那部分信号。
还有一种直接换掉特权信息的形式,用评分细则替代标准答案,让老师去验证多条不同的推理路径是否都符合评分标准,而不是死盯着一条标准路径。这么做多样性确实保住了,即便用的还是那个“覆盖式”的正向KL,熵也涨了回来,不过准确率的提升相对有限,而且手写的评分细则明显比让另一个模型自动生成的评分细则效果更好,这也说明这种方法目前还离不开人工投入。
最后一种做法比较巧妙,叫“分歧调制的策略自蒸馏”,它保留标准的特权信息不变,但在每一个词元处先看老师和学生的判断差多少:差距小就跟着老师走,差距太大就说明这里可能是特权信息把老师带偏了,直接忽略老师这次的判断。这个方法同时在准确率和多样性两个指标上都做到了不错的表现,证明这两者未必是不可兼得的。
旋钮三:老师这个角色该不该变
前两个旋钮讨论的是信号本身的形状和内容,第三个旋钮加入了时间维度:这个自己扮演的“老师”,权重要不要跟着训练进程一起变?
标准OPSD的做法是把老师彻底冻结在训练开始时的那个版本。这么做的问题很直白:学生越练越强,老师却原地不动,慢慢就跟不上学生的进步了,能给出的指导价值也就越来越有限。
但反过来,如果让老师实时跟着学生一起更新,又会出另一个问题:老师和学生变成了同一个不断漂移的东西,老师不再是一个外部的、稳定的参照系,它开始吸收学生的偏移,整个循环变成自说自话,自我确认而非自我修正。
这个矛盾其实计算机视觉领域五年前就遇到过,当时的自监督学习也面临类似的“自己教自己”循环,并且总结出了三条经验,可以直接搬到OPSD上用。
第一条是绝不能让梯度反向传播进老师,老师的输出必须被当成一个固定不变的目标,这个技巧叫“停止梯度”。有实验证明,如果不加这个限制,模型的准确率会直接崩到0.1%,几乎等于随机瞎猜。OPSD已经在用这一条了,而且做得更彻底,直接把老师的权重锁死在初始版本,一步都不让它动。
第二条是即便要更新老师,也要让它比学生慢,具体做法是用一种叫“指数滑动平均”(EMA)的方式,让老师的权重是学生历史权重的一个加权平均,而不是直接复制学生当前的权重。这样老师相当于“慢半拍”,既能吸收学生的进步,又不至于立刻被学生的临时波动带偏。
第三条是老师和学生之间必须保持某种结构上的不对称,光靠“慢”还不够,如果两者结构完全一样,最后会收敛成一个恒定不变的输出,等于什么都没学到。在OPSD里,这个不对称是天然存在的,因为老师能看到特权信息而学生看不到,正是这个信息差保证了两者不会真正合二为一。
打个比方,这就像师徒关系里,师傅如果什么都不留一手,事事都跟徒弟保持完全同步,那这段师徒关系其实就名存实亡了。正是因为师傅手里握着徒弟暂时够不着的东西(可能是经验,可能是内部信息),这段关系才有存在的意义。
2026年有两项研究专门针对“什么时候更新老师”和“更新多少”给出了细化方案。一项研究发现,如果老师更新的时机没选好,可能会在学生本身正处于漂移状态时,把一个已经跑偏的学生状态锁死进老师里,这个失败状态被称为“状态无关的坍缩”。补救方法是只在学生的表现确实提升了之后才刷新老师,两次刷新之间必须给老师留一段完全冻结、不吸收任何学生漂移的“隔离期”。另一项研究则关注老师和学生之间的“距离”,如果距离太远,梯度会变得又大又不稳定,导致训练发散,所以要把老师控制在一个类似“信任区域”的范围内,离学生不要太远。
除了老师本身要不要动,还有另一件独立的事:喂给老师的那份特权信息,是不是也该随训练进程逐渐减少?
这个思路在“课程学习”式的强化学习里早有先例:一开始给学生看几乎完整的解题过程,只留最后几步让它自己补全,随着训练推进,逐渐往前推,让学生自己补全的部分越来越多,最终完全独立作答。有研究把这个思路搬进了自蒸馏框架,发现一个反直觉的现象:并不是“老师永远全部展示”效果最好,而且老师和学生之间的分歧程度,会随着展示的解题过程比例增加而单调上升,这再次印证了前面提到的PMI机制,看得越多,老师越“不犹豫”,学生学到的犹豫词元也就越少。基于这个发现,研究者设计了一个自动调节机制,根据学生的学习速度动态调整展示比例:学得快就少展示点,卡住了就多展示点,测出来的收益在不同规模的模型上大约有1到2个百分点的提升。
关于评测这件事,得多说几句
前面讲了这么多方法上的进步,但有一件事必须先泼盆冷水:这些论文里报出来的分数,很大一部分可能没那么可靠。
原因有三个。第一是数学竞赛类测试集通常题量很小,比如AIME竞赛只有30道题,一道题的对错就能让总分波动超过三个百分点,换一个随机种子重新跑一遍,分差能到十五分。所以论文里那种“提升了三分”的说法,很可能只是噪声。
第二是数据污染。部分AIME 2024的题目其实已经出现在模型预训练用的数据里了,有些模型能把一半的题目直接从记忆里默写出来,但一遇到训练截止日期之后才发布的新题就露馅了。
第三是模型家族本身的特异性。有研究发现,在Qwen系列模型上,哪怕训练信号是完全随机、毫无意义的,分数也能莫名其妙地涨,但这个现象在Llama和OLMo这些模型上根本不存在,说明这跟预训练阶段学到的东西有关,跟你正在测试的方法本身没关系。
所以判断一个方法是不是真的有效,得看它有没有报告多个随机种子下的平均值、有没有给pass@k这类能反映多样性的指标、有没有用陌生的(未被污染的)测试集做对照、有没有换一个模型家族重新验证过。
写在后面
看完这一整套研究脉络,我最大的感触是:密集的监督信号从来不是免费的午餐。
它看起来很有诱惑力,因为它比稀疏的终点奖励包含更多信息,训练也更快。但密集恰恰意味着每一个词元都被赋予了意见,而当这个意见的来源(也就是老师)本身带着偏见(因为它偷看了答案),这种偏见也会被同样密集地灌输进学生的每一个角落。稀疏反而有个隐藏的好处:它逼着模型只在真正重要的地方(最终答案对不对)做出改变,中间过程反而留有余地。这也是为什么有研究发现,强化学习方法遗忘掉旧知识的速度,反而比密集的自蒸馏更慢。
另一个让我意外的细节是熵和多样性的脱钩。我们通常默认“熵高=更随机=更多样”,但实验证明一个模型完全可以维持很高的词元熵,同时实际能想出来的解题思路却越来越少。这提醒我,评价一个生成模型的“创造力”或者“灵活性”,光看它输出的统计分布是不够的,得真的去看它在不同尝试之间到底产生了多少功能上不同的结果。
还有一点值得多想一层:这篇综述反复强调的“可重建性”标准(学生能不能自己推导出特权信息),本质上是在回答一个更普遍的问题,就是什么样的帮助是真正的帮助,什么样的帮助是拐杖。一个总是被喂标准答案的学生,考试时会束手无策;一个只被引导去理解解题思路、但从没直接看过答案的学生,反而更可能在新题目前保持镇定。这个道理放在教育里其实老生常谈,但被一套严谨的机器学习实验重新证实一遍,还是挺有说服力的。
这套方法现在还处在研究阶段,论文作者自己也说得很直白:不建议直接拿去生产环境用。它的失败模式已经被记录得很清楚了,但怎么系统性地避开这些坑,还没有定论。
一个模型能不能真正教好自己,答案似乎取决于它愿不愿意,在教自己的时候,留一点点犹豫的空间。
Q&A
Q1:On-Policy Self-Distillation是什么?
A:简称OPSD,是一种让语言模型自己当自己老师的训练方法。模型生成答案后,同一个模型(但额外看到标准答案)会给这份答案逐词元打分,通过缩小两者判断的差距来训练模型,不需要额外的大模型当老师。
Q2:OPSD训练出来的模型为什么会出现坍缩问题?
A:因为老师版本提前知道了标准答案,会更强烈地奖励直接指向答案的词元,同时压制"等等""也许"这类犹豫、探索型词元。这些犹豫词元本来是模型多路径思考的关键,被压制后模型能想出的解法越来越少,即所谓的坍缩。
Q3:给OPSD的老师看完整答案效果最好吗?
A:不是,实验反而显示完整答案是效果最差的选择之一,有时甚至不如完全不给任何特权信息。效果较好的是分步提示、解题计划、评分细则这类"给技能不给答案"的中间层信息,因为学生能在推理时自己重建这些内容。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.