LoRA(低秩适配)是目前大模型微调最常用的方法之一,但它的一个初始设计细节,可能一直在拖慢训练速度。最近一篇论文提出了一种名为NoRA(归一化低秩适配)的改进方案,改动极小——只改一行代码,不增加任何参数,却能同时改善收敛速度、训练稳定性和灾难性遗忘问题。
问题出在LoRA的初始化方式上
![]()
LoRA在初始化时,将上投影矩阵(up-projection)设为零。这意味着训练早期,优化过程几乎完全由下投影矩阵(down-projection)主导。论文作者指出,这个观察恰恰指明了应该在哪里做正则化——既然下投影矩阵在初期承担了几乎全部的学习压力,那么对它进行归一化处理,就是最直接的优化切入点。
NoRA的核心做法,就是在训练过程中对下投影矩阵做归一化。更值得注意的是,作者发现,即使只在初始化时应用一次归一化,不重复贯穿整个训练过程,也能显著改善标准LoRA的表现。这个一次性方案,是两种做法中成本更低的选择。
效果覆盖预训练、微调和强化学习
论文的实验结果显示,NoRA带来的收益并非局限于单一场景。在预训练(pretraining)、监督微调(supervised fine-tuning)和强化学习(reinforcement learning)三种训练范式下,改进效果都保持一致:收敛速度更快、最终性能更好、训练过程更稳定,同时灾难性遗忘(catastrophic forgetting)现象也明显减轻。
这些收益的取得,没有以任何额外开销为代价。NoRA不增加可训练参数,也不引入推理时的额外计算量。这正是它区别于其他专门化LoRA变体的关键——它不是一个需要特定场景才能发挥作用的特化方案,而是一个可以广泛适用的通用改进。
为什么这个改动值得关注
LoRA之所以被广泛采用,核心优势就在于用极少的可训练参数实现高效的模型适配。任何在此基础上增加复杂度或计算成本的改进,都会削弱其应用价值。NoRA选择了一条不同的路径:不增加任何东西,只是调整已有的初始化方式,就换来了多方面的性能提升。
这种"减法式"的优化思路,在当下追求更大模型、更多参数的AI研究环境中显得尤为难得。它提醒我们,有时候性能瓶颈并不在于缺少复杂的机制,而在于已有机制中一个未被注意的细节。
对于正在使用LoRA进行模型微调的开发者来说,这个改动几乎零成本——一行代码的调整,不需要重新设计训练流程,也不需要额外的计算资源。如果复现结果与论文一致,这可能是近期性价比最高的训练优化方案之一。
论文全文可在academy.dair.ai/papers/normali…查看。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.