把后训练的数据集砍到只剩一条查询,模型还能涨多少分?清华NLP团队(OpenBMB成员)联合中国科学院大学、东北大学、UIUC和约翰霍普金斯大学,给出了一个反直觉的答案:87%。
这项名为 One-Shot OPD 的工作,把矛头对准了当前后训练流程里一个被默认接受的前提——训练集是给定的。Qwen3、MiMo、GLM-5、DeepSeek-V4、Kimi K3 都在用 on-policy distillation(OPD,在线策略蒸馏),让学生模型在自己访问到的每个前缀上,拿到老师的完整下一词分布,再配上 SFT 和 RL。但围绕 OPD 的研究几乎都站在算法一侧,数据这一侧很少被单独拎出来问一句:OPD 的增益里,数据到底占多大比重?
![]()
一条查询,几百步
答案藏在一条查询里。在数学任务上,只用一条查询做 OPD,到第 300 步时分数从 59.1 涨到 68.5;而用全量数据的 OPD 是 69.8。也就是说,单条查询拿到了全量数据增益的 87%。
这个结论不只在数学上成立。代码、指令跟随、智能体工具调用这几类任务上,结果一致;换到 Qwen、Llama、OLMo 等不同模型家族,结论依然站得住。更耐人寻味的是,一条学生模型从来没解出来的查询,和一条它每次都能解出来的查询,效果差不多。
这说明起作用的不是题目本身,而是题目把学生带到了哪些状态上。
要的是状态,不是问题
研究团队给出的解释是:一个前缀就是一个状态,老师在这个状态上给出目标分布。所以每一步采样 64 条 rollout,就已经能产出数万个有监督的位置。
数据也支持这个说法。一条查询能达到全量数据 OPD 所访问状态的 71.5% 覆盖率;把查询增加到 16 条,覆盖率升到 98.9%,效果追平全量数据。多出来的查询买到的不是更多问题,而是更多状态。
这也解释了为什么单条查询能撑起几百步训练——它提供的监督信号密度,远超"一条题"这个字面印象。
拖慢训练的是对齐,不是数据
既然一条查询就够,为什么一次训练还要跑几百步,而不是几十步?
团队发现,学生模型一直在进步,但每一次更新能吸收的"剩余部分"越来越少,这种对齐速度的放缓才是训练长度的决定因素。而且这个放缓几乎不取决于训练集大小:在 1 条、4 条、16 条和全部 17k 条查询上,对齐放缓的节奏差不多。
限制一次训练的不是它拿到多少数据,而是学生吸收得有多快。用论文里的话说,OPD 是"数据喂过头、算法饿着"。
对做后训练的人来说,这个结论的实际含义很直接:与其继续堆数据,不如把注意力放回算法侧——怎么让学生吸收得更快,才是那根真正卡住训练时长的绳子。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.