失败轨迹里的信号,被白白扔掉了
用教师模型生成的轨迹做监督微调,是把工具调用能力蒸馏进可部署模型的标准第一步。但现有流程每天都在重复同一件事:生成一批轨迹,留下通过的,丢掉失败的。问题在于,失败的那部分恰恰是最难啃的场景,而它们没有提供任何训练信号。
![]()
在 τ 2-bench 上,教师模型的试验有 57% 失败,其中三分之二是“差一点就成”——大部分工具调用都正确,只被一个关键错误毁掉。这些近失轨迹被直接丢弃,意味着每个训练周期都在为同样的硬场景重复付费,却始终学不会。
PROOF-Gen:从失败里回收黄金轨迹
研究团队提出了 PROOF-Gen,全称是 Per-scenario Reflective Optimization to Overcome Failed Generation,即“逐场景反思优化以克服失败生成”。它的思路是:对每个失败任务,让一个反射器分析执行轨迹和评估反馈,然后写出纠正性指导,引导教师模型生成一条能通过的轨迹。
关键的一步在训练前:这些指导会被剥离。学生模型最终学到的是干净的示范,不依赖任何任务特定的脚手架。换句话说,反射器只在数据生成阶段起作用,不会进入学生模型的推理路径。
93%的失败场景被救回来了
在 τ 2-bench 上,逐场景优化恢复了 93% 的失败场景。把恢复后的数据与原有通过轨迹合并做微调,Qwen3-4B-Instruct-2507 的 Passˆ1 从 0.132 提升到 0.529。Gemma 4 E4B-it 在 BFCL v4 多轮任务上提升了 7.2 个百分点。
在部署管线中的效果同样明确:轨迹质量的目标完成率提升 6.3 个百分点,并且能迁移到已部署的端侧模型——目标完成率提升 1.5 个百分点,响应质量指标提升 1.7 到 5.0 个百分点。非英语地区的迁移全部为正,平均提升 1.48 个百分点。
蒸馏的另一面:什么时候有用,什么时候有害
与 PROOF-Gen 同期受到关注的,还有关于在线策略蒸馏的讨论。在线策略蒸馏能为训练推理模型提供密集的逐令牌监督,但什么条件下这种信号有益、什么条件下有害,目前并不清楚。该用哪个教师模型?自蒸馏时该用哪个上下文作为监督信号?最优选择是否随令牌变化?这些问题在 2026 年 7 月 9 日的研究中仍待回答。
更早的蒸馏缩放定律研究则从算力预算角度切入,提出根据学生和教师的算力分配来估计蒸馏模型性能。这项 2025 年 ICML 工作给出的核心价值是:在大规模蒸馏前,先算清楚教师和学生的算力最优分配,以最大化学生性能。
从“生成-过滤”到“生成-反思-恢复”
PROOF-Gen 的真正改变在于把失败轨迹从垃圾变成了原料。传统流程是生成后过滤,失败即丢弃;PROOF-Gen 在过滤后加了一步反思优化,让失败场景有机会被纠正成可用的黄金轨迹。这直接回应了一个长期存在的效率问题:教师模型很贵,但它的失败尝试没有被利用。
对需要按日或按周重跑训练管线的团队来说,这意味着每一轮教师调用都可能产出更多有效数据。失败不再只是成本,而是可以被转化为下一轮训练的信号来源。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.