DeepMind 又对 Transformer 架构动刀了。这次提出的 回流机制,思路很直接:不改动任何权重,让深层激活回流到浅层,重新参与计算。
实验结果显示,这一机制能显著提升语言建模性能。在特定设置下,仅用一个小模块就能反超全量微调的效果。
![]()
核心思路:激活回流
传统 Transformer 的信息流是单向的,深层只能消费浅层传来的信息。回流机制打破了这一路径,将深层的激活值重新注入浅层,相当于给网络增加了一条“回头路”。
关键在于,这条回流路径不涉及权重更新。也就是说,模型参数保持不变,纯粹通过改变激活的流动方式来提升表现。
小模块为何能反超?
全量微调需要更新所有参数,成本高且可能破坏预训练知识。回流机制提供了一种轻量替代方案:只训练一个负责回流的小模块,就能达到甚至超过全量微调的效果。
这一结果对参数高效微调(PEFT)领域是个有力补充,也暗示着 Transformer 的信息流设计仍有不小的优化空间。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.