网易首页 > 网易号 > 正文 申请入驻

Thinking Machines曝LoRA终极指南:10倍学习率,媲美全参微调

0
分享至

新智元报道

编辑:元宇

【新智元导读】LoRA能否与全参微调性能相当?在Thinking Machines的最新论文中,他们研究了LoRA与FullFT达到相近表现的条件。Thinking Machines关注LoRA,旨在推动其更广泛地应用于各种按需定制的场景,同时也有助于我们更深入审视机器学习中的一些基本问题。

今天,Thinking Machines重磅推出了它的第三篇论文《LoRA Without Regret》。

博客地址:https://thinkingmachines.ai/blog/lora/

论文由John Schulman与Thinking Machines其他人联合完成。

如今,最先进的大模型参数量已经超过一万亿,预训练数据量常常多达数十万亿Token。

如此庞大的参数对于基础模型性能的提升是必要的。

但这在后训练阶段就显得有些浪费了,这正是参数高效微调(PEFT)出现的原因。

最常用的方法是LoRA(低秩适配)。它的思路是不直接更新原始的巨大权重矩阵W,而是给它加上一个小小的修正项:

W′=W+γBA

这里的B和A是两个低秩矩阵,它们的参数数量远少于W,而γ是一个常数缩放因子。

换句话说,LoRA通过低维矩阵乘积来捕捉微调带来的更新。那么LoRA能否与完全微调性能相当?如果可以,又是在什么条件下?

Thinking Machines研究发现,只要把握几个关键细节,LoRA也可以与FullFT达到相近表现

LoRA的关键因素

在本文中,研究人员通过一系列监督微调与强化学习实验,探讨LoRA在何种条件下能与FullFT一样高效。

研究人员发现:

  • 在小到中等规模的指令微调和推理数据集上,LoRA与FullFT表现相同。

  • 对于超出LoRA容量的数据集,LoRA的表现劣于FullFT。

  • 在某些场景中,LoRA对大批量训练的容忍度低于FullFT。

  • 即便在小数据场景下,LoRA应用到所有权重矩阵(尤其是MLP和MoE层)时效果更佳。

  • 在强化学习中,即使是低秩LoRA,表现也与FullFT相当。

研究人员在Tulu3数据集和OpenThoughts3的一个子集上进行单轮训练,针对每个数据集和模型规模遍历了LoRA秩和学习率。

研究人员发现,FullFT与高秩LoRA的学习曲线相似,损失随训练步数对数线性下降。而中低秩LoRA会在某个与秩相关的阈值步数之后偏离最小损失曲线。

从直观上看,当适配器容量耗尽时,学习速度会放缓,这由秩决定。

通过绘制损失随学习率变化的曲线,研究人员确认学习率搜索覆盖了每个秩的最佳值,发现FullFT的最佳学习率比高秩LoRA低约10倍。

批大小效应

在训练神经网络时,我们不会一次把所有数据都丢进去,所以用批大小(batch size)来衡量每一批数据中包含多少个样本。

研究人员在实验中发现,在某些情况下,LoRA对大批量训练的容忍度低于FullFT。性能差距随批量增大而扩大,与秩无关。

实验人员使用了OpenThoughts3的一个10000样本的小型子集。

图3左图显示了在大批量下,LoRA(虚线)与FullFT(实线)的学习曲线始终存在差距。而在较小批量(32)下,这一差距更小且随时间缩小。

右图展示了最终损失随批量大小的变化。可以看到,随着批量增大,LoRA的损失与FullFT的差距逐渐拉大。

大批量下的学习差距似乎与秩无关,而是LoRA固有的特性。

研究人员认为其可能原因在于矩阵乘积参数化(BA)的优化动态不如完整矩阵(W)。

LoRA应用层研究

研究人员将LoRA应用于网络不同层,发现当把LoRA应用于所有层时,尤其是MLP(包括MoE)层时,效果要好得多。

实际上,把LoRA用在注意力矩阵上并没有比只用在MLP上更有优势。仅注意力的LoRA表现不佳,并不是因为参数更少。

在这个实验中,rank=256的仅注意力LoRA表现不如rank=128仅MLP LoRA,尽管它们的参数量差不多(见下表加粗数字对比)。

研究人员还在两个额外场景下做了类似的对比实验:

(1)在OpenThoughts3数据集的小子集上(rank=256)做监督学习;

(2)在MATH数据集上做强化学习。

在这两种情况下,仅注意力LoRA的表现依然不如仅MLP LoRA。

强化学习

该实验的一个关键发现是:在用策略梯度算法做强化学习时,即使rank低至1,LoRA也能完全匹配全参数微调的学习效果。

图6中展示了在MATH数据集和GSM数据集上的学习率扫描结果,使用了各自常用的超参数。

研究人员采用了Llama-3.1-8B基座模型,发现LoRA展现出更宽的有效学习率范围,并能达到与全参数微调(黑线)相同的峰值性能。

为了进一步验证LoRA在推理强化学习中的有效性,研究人员还在DeepMath数据集上做了更大规模的实验。

研究人员观察到,在每个设定下选择最优学习率时,不同大小的LoRA与全参数微调的训练进展几乎完全一致。

设置LoRA超参数

LoRA采用的一个障碍在于必须选择合适的超参数,而这些超参数与为FullFT优化的并不相同。

研究人员采用了如下的LoRA参数化方式:

其中,r是LoRA秩,α是LoRA缩放因子,A、B是LoRA权重矩阵(秩为r)。在本文的实验中,研究人员采用α=32。

图9展示了在相同学习率下,不同秩在训练初期学习曲线的差异。

LoRA与FullFT的最优学习率比较

该实验表明,在相同的应用中,无论是监督学习还是强化学习,LoRA的最优学习率始终是FullFT的10倍。

这一点在性能(损失或奖励)随学习率变化的U形曲线中一再出现。

这说明可以更容易地把FullFT的学习率迁移到LoRA中。

研究人员目前还没有对这一观察给出充分的理论解释,但认为可以尝试从以下事实出发推导:LoRA的最优学习率与秩无关,而满秩LoRA可直接与FullFT对比。

在实证分析中,研究人员对14个不同的Llama和Qwen模型在Tulu3数据集上同时进行了LoRA和FullFT的学习率扫描。

通过这些扫描结果拟合了一个函数,能基于模型的隐层维度以及其来源(Llama或Qwen)来预测最优学习率:

在短期和长期训练中的学习率方面,LoRA的典型初始化方式会在有效学习率上隐式引入一个随时间变化的调度,这导致短期和长期训练表现出差异,且与FullFT相比,学习曲线形状也有所不同。

在训练开始时,B初始化为零。当B很小时,A的变化对适配器BA的影响几乎可以忽略。

随着B逐渐变大,A的更新对网络输出的影响开始增大,有效学习率会随着训练进程逐渐提升,因为B的规模逐渐接近A。

研究人员发现,在Tulu3和OpenThoughts数据集的完整训练结束时,B矩阵的谱范数比A矩阵更大。

这意味着在短期训练中,最优学习率应该设得更高。

初步证据表明,在短期(大约100步以内)训练时,LoRA最优倍数大约是FullFT的15倍,随着训练时间变长,收敛到前文提到的10倍。

在本文的研究中,研究人员发现LoRA与FullFT达到相近表现需要满足的两个条件:

条件1:LoRA应用于网络的所有层,尤其是包含大多数参数的 MLP/MoE(混合专家)层。

条件2:在不受容量约束时,LoRA表现良好,即可训练参数的数量要多于需要学习的信息量。

当条件1满足时,训练一开始就会看到与FullFT相似的学习动态。随后,依据条件2,LoRA会持续呈现与FullFT相近的表现,直到开始触及容量上限为止。

Thinking Machines关注LoRA,旨在推动其更广泛地应用于各种按需定制的场景,也有助于帮助我们更深入地审视机器学习中的一些基本问题。

参考资料:

https://thinkingmachines.ai/blog/lora/%20

https://x.com/thinkymachines/status/1972708674100765006

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
普京自爆绝境!俄罗斯最可怕的不是战争损耗,是彻底输掉了未来

普京自爆绝境!俄罗斯最可怕的不是战争损耗,是彻底输掉了未来

浪子的烟火人间
2026-08-04 00:45:03
深夜,全线拉升!科技巨头,飙涨!近6年最大买盘突现,发生了什么?

深夜,全线拉升!科技巨头,飙涨!近6年最大买盘突现,发生了什么?

券商中国
2026-08-03 23:57:38
第二个富士康?宣布全线搬迁、近10万工人丢掉饭碗,央媒早有预警

第二个富士康?宣布全线搬迁、近10万工人丢掉饭碗,央媒早有预警

云舟史策
2026-08-03 11:48:56
多个省级党委领导班子调整

多个省级党委领导班子调整

上观新闻
2026-08-03 11:52:37
《角头》演员李振豪拐卖49人赴柬埔寨被判36年

《角头》演员李振豪拐卖49人赴柬埔寨被判36年

蹲坑看世界
2026-08-03 20:58:23
广东一医院发生一级甲等事故,已刑事立案!另一事故首诊医生被刑拘,入刑需谨慎,别让医生不敢看病

广东一医院发生一级甲等事故,已刑事立案!另一事故首诊医生被刑拘,入刑需谨慎,别让医生不敢看病

医脉圈
2026-08-03 21:37:34
美国制裁洽洽瓜子、思念水饺、七匹狼男装等,对相关产品进入美国市场实施进口限制

美国制裁洽洽瓜子、思念水饺、七匹狼男装等,对相关产品进入美国市场实施进口限制

扬子晚报
2026-08-03 12:15:37
一台沃尔沃S90卖出了B级车的价钱,BBA的销售们开始有点慌了

一台沃尔沃S90卖出了B级车的价钱,BBA的销售们开始有点慌了

财圈社
2026-08-03 20:09:28
机器人刷一段「短视频」,就能学会新技能?自变量 HOST 技术「神器」来了

机器人刷一段「短视频」,就能学会新技能?自变量 HOST 技术「神器」来了

爱范儿
2026-08-03 17:09:55
赵祥松|竹知了

赵祥松|竹知了

祥松谈
2026-08-03 17:47:53
国家电网的“降薪”争议:为什么越来越多员工觉得待遇不如从前?

国家电网的“降薪”争议:为什么越来越多员工觉得待遇不如从前?

你在偷看谁
2026-08-03 18:43:07
泽连斯基特别点名!被击沉的10万吨级集装箱船,属于俄罗斯国家原子能公司

泽连斯基特别点名!被击沉的10万吨级集装箱船,属于俄罗斯国家原子能公司

鹰眼Defence
2026-08-03 15:31:45
宁波砸伤瓜摊主案:赔偿账单竟有多离谱?协商进展为何卡“零”?

宁波砸伤瓜摊主案:赔偿账单竟有多离谱?协商进展为何卡“零”?

社会日日鲜
2026-08-03 10:27:17
“他快饿死了,你还嫌他花的多!”男大学生一天花50被妈妈骂,网友一边倒!

“他快饿死了,你还嫌他花的多!”男大学生一天花50被妈妈骂,网友一边倒!

林林先生
2026-08-02 08:35:06
游客从青海察尔汗盐湖捡盐块带回家留念引关注,当地文旅及景区回应:盐块矿物质可能会超标,或有微毒,不建议捡拾

游客从青海察尔汗盐湖捡盐块带回家留念引关注,当地文旅及景区回应:盐块矿物质可能会超标,或有微毒,不建议捡拾

台州交通广播
2026-08-03 01:12:14
西班牙飞地休达边境,摩洛哥士兵搬起大石块投向移民引争议,此前一天内数万人从摩洛哥涌入西班牙

西班牙飞地休达边境,摩洛哥士兵搬起大石块投向移民引争议,此前一天内数万人从摩洛哥涌入西班牙

极目新闻
2026-08-03 14:50:33
贫富差距彻底失控!再不强力干预,等待社会的只有崩盘洗牌

贫富差距彻底失控!再不强力干预,等待社会的只有崩盘洗牌

阿振观点
2026-08-03 21:56:53
理想和极氪将直播拆车,小米徐洁云发文“为坦坦荡荡的同行鼓掌”

理想和极氪将直播拆车,小米徐洁云发文“为坦坦荡荡的同行鼓掌”

IT之家
2026-08-03 20:00:11
“地表最强男人”,遇难

“地表最强男人”,遇难

中国新闻周刊
2026-08-03 16:45:05
日本发出强硬警告,如果中国继续实施导弹试射,我们就加速拥核!

日本发出强硬警告,如果中国继续实施导弹试射,我们就加速拥核!

棠棣分享
2026-08-03 12:40:15
2026-08-04 03:43:00
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
15857文章数 66995关注度
往期回顾 全部

科技要闻

“像魔法一样”的AI,只卖几分钱

头条要闻

特朗普:2029年1月前控制格陵兰岛

头条要闻

特朗普:2029年1月前控制格陵兰岛

体育要闻

马克龙介入FIFA危机 致电因凡蒂诺勿搞分裂

娱乐要闻

陈璇半蹲采访诺兰惹争议

财经要闻

美日联手,救得了日元吗?

汽车要闻

方程S系列将于成都车展发布内饰 9月上旬新车上市即交付

态度原创

旅游
本地
健康
亲子
手机

旅游要闻

8月3日最佳情报|七星台柑橘凤蝶舞荆花,市民趵突泉赏泉寻清凉

本地新闻

神仙也“蓉”漂,哪吒与八仙,皆是成都出品!

干细胞和衰老有什么联系?

亲子要闻

月嫂回乡给父亲祝寿,宝妈发愁没人看娃,月嫂邀我带孩子一同赴宴

手机要闻

想换手机先等等!下月新旗舰将密集发布

无障碍浏览 进入关怀版