深层算出的信息,浅层一直没看到
Google DeepMind发布的一项新研究指出,Transformer的浅层网络始终无法直接获取深层网络已经计算出的上下文信息。论文提出,在推理阶段把深层激活的一小部分回灌到浅层,可以找回一部分原本丢失的内容。
![]()
这项方法被命名为“Recirculation”。如果模型在处理长输入时持续丢失状态,修复方式可能不需要重新训练,但代价是成本转移到预填充阶段,预填充将无法再并行运行。
冻结权重下依然有效
论文显示,该方法在冻结权重的情况下仍然能够工作。不过,收益的大小并不能在不同模型家族之间直接迁移。
具体做法是,在下一个输入步骤中,把深层激活的一小部分混合进浅层激活,权重保持不变,再与现成的原始模型进行对比。
Gemma3上10个数据集9个下降
在Gemma3模型上的测试结果显示,10个语言建模数据集中有9个出现困惑度下降。对于12B模型,困惑度最高下降了35%。不过,多项选择题上的提升幅度相对有限。
研究论文可通过arxiv.org/abs/2608.17981查看,标题为“Recirculation”。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.