亚马逊一篇新论文指出,KV缓存策略不只是推理阶段的优化手段,它反过来决定了模型该怎么训练。如果模型在推理时会丢掉一部分上下文,那训练时也应该主动模拟这种遗忘。
训练与推理不匹配,是长上下文失效的根源
![]()
论文里的做法很直接:把微调过程和KV缓存策略对齐。在128k token的测试里,用全注意力微调的模型,一旦换成稀疏推理,输出就变得冗长且没有意义。而按缓存策略微调的模型,能正常作答,也知道什么时候该停。
任意缓存策略都能用,显存门槛不高
这套方法不挑缓存策略,支持任意一种。计算4B模型梯度,在40 GB A100上就能跑起来。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.