教师模型的“出身”,比分数更关键
一篇关于模型蒸馏的研究给出了一个反直觉的结论:学生模型复制的是教师模型的推理方式,而不是教师模型掌握的知识本身。这意味着,教师模型来自哪个模型家族,远比它在基准测试上的分数重要。
![]()
研究指出,一个从学生模型自身基础模型构建出来的较弱教师模型,反而能比来自不同模型家族的更强教师模型,把学生带得更远。
训练数据几乎不影响结果
论文发现,训练数据的影响微乎其微。无论你拿教师模型总能解出的题目、永远解不出的题目,还是随机混合的题目来训练,学生模型最终都会落在差不多的位置。
甚至只用小学数学级别的题目,也能获得超过80%的收益。这个结果说明,蒸馏过程中真正传递的东西,并不藏在题目本身。
教师解不出的题,也能教给学生
更值得注意的一点是:教师模型可以教会学生一道它自己都解不出的题。因为跨模型传递的是一种推理习惯,而不是某道题的答案或解题能力。
这解释了为什么教师模型的推理方式,比它的知识储备更能决定学生模型的上限。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.