大模型训练有个长期存在的矛盾:同一个隐藏状态(hidden state)要同时干两件事——既要记住上下文,又要预测下一个词。这两项任务挤在同一份计算资源里,互相抢地盘。微软和康奈尔大学联合发表的一篇新论文,提出了一种看起来有点反直觉的解法:给预测任务单独开一份计算,但代价小得惊人。
论文标题叫"Free Pause Tokens"(免费暂停令牌),核心思路是让模型在训练过程中"暂停"一下,把额外的计算资源专门用于预测任务。关键在于,这种暂停不需要增加新的token,不会撑大KV缓存(key-value cache,存储注意力机制中间结果的缓存),也不需要额外的解码步骤。换句话说,它绕开了所有常见的"加计算"副作用。
![]()
效果对比:少训练一半,成绩追平
论文给出的数据相当直观:用这个方法训练的模型,效果追平了一个在多50%的token上训练的标准模型。而代价仅仅是训练时间增加14%,推理延迟增加约1%。这意味着,原本需要喂给模型100份数据才能达到的效果,现在用67份数据就能做到,省下的算力成本相当可观。
更关键的是,这套方法不需要全程开启。论文发现,当训练进行到42.5%时再打开"免费暂停"功能,模型能保留约94%的完整质量提升,而训练耗时只是普通模型的1.33倍。如果按总算力消耗(node-hours)来算,分阶段使用这个方法的版本,依然能击败标准训练流程。
推荐用法:大部分时间正常训练,收尾阶段加料
论文给出的建议很务实:训练的大部分时间保持正常流程,只在接近尾声时,把额外的预测计算加进去。这种"先正常跑,后段加力"的策略,既避免了全程开启带来的额外开销,又能在关键阶段把模型质量推上去。
这个思路之所以有效,是因为它精准地回应了那个"两个任务抢一份计算"的矛盾。在训练前期,模型还在学习基本的语言规律,上下文追踪和预测任务之间的冲突没那么明显;到了训练后期,模型已经接近收敛,这时候给预测任务单独加计算,就能把质量天花板再顶高一点。
对训练成本意味着什么
如果这个方法的结论能在大规模训练中稳定复现,它对算力预算的影响是直接的:同样的效果,可以少训练约三分之一的数据量。对于动辄数百万美元训练成本的大模型来说,这省下的不是小数目。而且,推理阶段几乎不受影响(延迟只增加1%),意味着部署端不需要额外投入。
当然,论文目前还只是预印本阶段(arXiv编号2609.03807),距离工程落地还有一段距离。但它指出的方向——给预测任务单独分配计算,而不是让一个隐藏状态硬扛两件事——确实值得关注。毕竟,在算力成本高企的当下,任何能"少花钱办同样事"的方法,都值得多看一眼。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.