微软研究团队指出,标准监督微调(SFT)会持续在模型已经拟合的序列上消耗梯度,这直接收窄了后续强化学习(RL)所需的探索分布。TailSFT在训练过程中过滤掉这些序列,把学习重点放在数据中欠拟合的尾部。
核心机制
![]()
TailSFT的做法不是增加数据,而是减少无效训练。当模型对某些序列已经掌握得很好时,继续在这些序列上更新梯度,反而会压缩模型在RL阶段的探索空间。过滤掉已拟合序列后,模型能把更多训练资源投向那些还没学好的尾部样本。
实验数据
在OLMo-3 7B模型上,TailSFT带来的提升相当具体:编程任务上pass@16最高提升16.8个绝对点,数学任务提升3.1点。经过GRPO强化学习后,最终pass@1最高提升3.9点,部分场景下早期奖励提升速度加快了2.5倍。
实际意义
这套方法的价值在于,它不改变模型架构,也不增加训练数据,只调整了SFT阶段的数据筛选策略。对于已经在做RL微调的团队来说,TailSFT提供了一个低成本的切入方式:先识别哪些序列已经拟合,再把它们从训练集中拿掉。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.