网易首页 > 网易号 > 正文 申请入驻

将注意力旋转 90 度!今天,Kimi 的「注意力残差」火了

0
分享至

编辑|冷猫

自从 2015 年 ResNet 诞生以来,这种「将输入直接加到输出上」的简单逻辑,统治了几乎所有神经网络架构。

但就在刚刚,沿用了十年的残差机制「升级」了。随橙想呢,替代方法竟然是「注意力机制」

就连 OpenAI 「推理模型之父」,主导了 o1/o3 系列、Codex 编程模型及 GPT-4 的 STEM 能力开发的 Jerry Tworek 都深受这一论文启发,认为应当重新思考之前的一切,「深度学习 2.0」的时代即将到来

这篇颠覆传统残差连接机制的工作来自Kimi 团队,发布了一项重磅技术报告:Attention Residuals ,该方法旨在通过对前序层进行学习到的、依赖输入的注意力机制,来取代标准的深度递归。

  • 论文标题:Attention Residuals
  • 论文链接:https://github.com/MoonshotAI/Attention-Residuals/blob/master/Attention_Residuals.pdf
  • 项目链接:https://github.com/MoonshotAI/Attention-Residuals

时间与深度的对偶

要理解Attention Residuals 是在做什么,我们得先看传统的残差连接 y = x + f (x) 出了什么问题。

在大模型向更深、更强演进的过程中,这种残差的加法机制带来了两个副作用:

1.信息稀释: 残差连接采用固定单位权重的均匀聚合,导致浅层特征在向深层传递时,其相对贡献度随深度线性衰减。这种「信息稀释」现象限制了深层网络对底层原始表示的直接利用能力。随着层数增加,第一层的信息传到第一百层时,已经被后面九十九层的信息层层冲淡。

2.隐藏状态爆炸:为了在不断累加的残差流中维持信号强度,深层模块往往需要输出模长更大的激活值。这种隐状态的无序扩张不仅破坏了数值稳定性,还导致梯度分布不均,增加了超大规模模型训练收敛的难度,直接导致了训练的不稳定性。

本文的天才之处在于,发现模型的「深度」其实就是另一种形式的「时间」

论文作者之一的 Yulun Du 老师道出了该论文的核心思想:将注意力旋转 90°

Attention Residuals (AttnRes)由此诞生:为每一层配备了一个「智能筛选器」。每一层都会发出一个 Query,去之前的所有层里寻找最相关的特征,并按需分配权重进行聚合。

注意力残差

理论重构:完整的注意力残差

传统的残差连接(ResNet)本质上是深度递归:它像 RNN 一样,把过去所有层的信息死板地 「压缩」进一个求和状态中。

  • 核心创新: 既然 Transformer 用注意力机制取代了 RNN,解决了长序列的遗忘问题;那么 AttnRes 就在深度上取代了残差累加。
  • 数学实现: 每一层不再是简单地加上前一层,而是发出一个可学习的 Query,去和之前所有层产生的 Key 做匹配。
  • Softmax 权重: 通过 Softmax 归一化,模型可以 「挑选」 出对自己最有用的某几层。比如第 50 层可以直接提取第 2 层的特征,权重占比可以高达 0.8,而不用担心被中间的 48 层稀释。

工程落地:Block AttnRes 的分块策略

  • 效率奇迹: 实验发现,即便模型有上百层,只要划分成 N≈8 个块,就能获得绝大部分性能增益。
  • 复杂度骤降: 内存开销从随层数 L 增长,降到了随块数增长。这意味着你可以用极小的代价(推理延迟增加 < 2%),获得一个 「更聪明」 的深层网络。

图 1:Attention Residuals 概览:(a) 标准残差(Standard Residuals): 采用均匀加法累加的传统残差连接方式。(b) 全量注意力残差(Full AttnRes): 每一层都通过学习到的注意力权重,有选择地聚合之前所有层的输出。(c) 块注意力残差(Block AttnRes): 将各层划分为若干个「块」,将内存开销从 O (Ld) 降低至 O (Nd)。

战果:1.25 倍的「计算杠杆」

根据论文信息,实验架构与 Kimi Linear 完全一致,这是一种遵循 Moonlight / DeepSeek-V3 设计的混合专家模型(MoE)Transformer。唯一的修改是在残差连接中加入了 AttnRes;模型深度、隐藏维度、专家路由和 MLP 结构等其他组件均保持不变。

研究团队测试了五种模型规模,并为每种规模训练了三个变体:PreNorm 基准模型、全量 AttnRes 以及约 8 个块的 Block AttnRes。

下图展示了拟合后的规模化曲线。

三个变体的斜率相似,但 AttnRes 在整个计算范围内一致实现了更低的损耗(Loss)。基于拟合曲线,在 5.6 PFLOP/s-days 的计算量下,Block AttnRes 的损耗为 1.692,而基准模型为 1.714,这相当于1.25 倍的计算优势(Compute Advantage)。随着模型规模增大,Full 与 Block 变体之间的差距在缩小。

研究团队的最大模型基于 Kimi Linear 48B 配置:27 个 Transformer 块(共 54 层),在 256 个路由专家中激活 8 个,外加 1 个共享专家,总参数 48B,激活参数 3B。该模型采用 Block AttnRes,每块 6 层,共产生 9 个块外加 1 个 Token 嵌入,形成 10 个深度方向的来源。

上图展示了模型在 1T token 训练过程中的动态变化:

  • 验证损耗: AttnRes 在整个训练过程中始终保持较低的验证损耗,尤其在衰减(Decay)阶段差距进一步拉大。
  • 输出量级: 基准模型遭受PreNorm 稀释问题:随着隐状态量级随深度单调增长,深层网络被迫从固定缩放的归一化输入中学习越来越大的输出,以维持影响力。而 Block AttnRes 将这种增长限制在每个块内,通过块边界的选择性聚合重置了累加过程,呈现出有界的周期性模式。
  • 梯度量级: 在所有残差权重固定为 1 的基准模型中,梯度流在深度上的分布极不均匀,导致早期层梯度过大。Block AttnRes 的可学习 Softmax 权重引入了来源之间的竞争,从而实现了显著更均匀的梯度分布

下游性能表现: 如上表所示,Block AttnRes 在所有评测任务中均达到或超过了基准模型。

  • 提升显著的任务: 在多步推理任务中提升尤为突出,如GPQA-Diamond (+7.5)Minerva Math (+3.6)以及代码生成HumanEval (+3.1)
  • 知识类任务MMLU (+1.1)TriviaQA (+1.9)也展现了稳健的提升。

数据给出了最有力的证明:

  • 计算效率: 达到同样的性能,AttnRes 相比传统残差节省了约20% 的计算量(1.25x 优势)。
  • 逻辑推理: 在数学、代码等硬核任务上提升显著。例如,在极难的 GPQA-Diamond 测试中,性能提升了7.5 分
  • 稳定性: 成功抑制了隐藏状态的数值爆炸,让深层网络依然能保持「冷静」和「高效」。

总结:Rethink & Imagine

用更高维的视角看基础架构的研究,时间和空间都是相通的。

这篇论文「将注意力旋转 90°」的思想,似乎带给 Karpathy 一些启示和思考。

ResNet 的残差流是信息在不同空间深度上的传递。SGD (随机梯度下降)的权重流是信息在不同时间维度上的传递。

研究团队觉得 ResNet 的加法太朴素了,所以提议用 Attention 来筛选过去每一层的输出。 既然 SGD 也是 ResNet,「Attention is All You Need」,那我们为什么不能在优化器里也加上 Attention?

架构的生命力,往往来自于对惯性的反思。

当我们回过头去审视那些基础架构,或许就能在过去的故纸堆中,发现更多通往未来的巧妙结合。

更多信息,请参阅原论文。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
马斯克的妹妹从小就坚信,跟着哥哥有肉吃,瞒着妈妈把南非家里的房和车都卖了去加拿大投奔哥哥!妈妈哭笑不得的承认是事实!

马斯克的妹妹从小就坚信,跟着哥哥有肉吃,瞒着妈妈把南非家里的房和车都卖了去加拿大投奔哥哥!妈妈哭笑不得的承认是事实!

大白聊IT
2026-08-14 01:29:05
辽宁富豪一家被灭门,保姆装死幸存,15年后才敢说出当晚实情

辽宁富豪一家被灭门,保姆装死幸存,15年后才敢说出当晚实情

悬案解密档案
2025-04-02 11:31:49
好心酸,被嘲讽了

好心酸,被嘲讽了

越女事务所
2026-09-17 22:55:22
发现一个残忍真相:极度自律,每天锻炼的人,不一定能长寿,但是,极度自私,不为任何人、任何事操心的人可能长寿

发现一个残忍真相:极度自律,每天锻炼的人,不一定能长寿,但是,极度自私,不为任何人、任何事操心的人可能长寿

品读时刻
2026-09-18 09:08:45
一觉醒来,中国斯诺克6胜6负!4场6-3,2将淘汰冠军,肖国栋翻车!

一觉醒来,中国斯诺克6胜6负!4场6-3,2将淘汰冠军,肖国栋翻车!

刘姚尧的文字城堡
2026-09-19 08:08:53
离谱!名古屋亚运会邮轮的床是纸板拼成的 新加坡选手当场震惊

离谱!名古屋亚运会邮轮的床是纸板拼成的 新加坡选手当场震惊

念洲
2026-09-18 16:39:48
工地五年换三个"临时媳妇",46岁光棍咧嘴笑:搭伙比结婚香多

工地五年换三个"临时媳妇",46岁光棍咧嘴笑:搭伙比结婚香多

真实人物采访
2026-09-18 11:00:00
套现146亿后跑路新加坡就能万事大吉?国家新规重拳出击:只要钱还在中国赚,拿了绿卡也照样得补税!申通前老板如意算盘,这下彻底落空了

套现146亿后跑路新加坡就能万事大吉?国家新规重拳出击:只要钱还在中国赚,拿了绿卡也照样得补税!申通前老板如意算盘,这下彻底落空了

人生录
2026-08-16 00:05:13
8891公里的信任...

8891公里的信任...

西楼饮月
2026-09-17 00:09:20
CCTV5直播!国足VS马尔代夫,邵佳一掀起青春风暴,赵松源有望创历史

CCTV5直播!国足VS马尔代夫,邵佳一掀起青春风暴,赵松源有望创历史

篮球圈里的那些事
2026-09-18 14:52:35
日本人评价抗美援朝:中国如果不发兵,美国根本走不到鸭绿江边

日本人评价抗美援朝:中国如果不发兵,美国根本走不到鸭绿江边

磊子讲史
2026-09-18 17:03:50
《兰香如故》大结局:原来,这才是林秀茹感激许兰香的真实原因

《兰香如故》大结局:原来,这才是林秀茹感激许兰香的真实原因

阿废冷眼观察所
2026-09-19 04:28:44
欧洲已经乱了阵脚,泽连斯基捅出这么大篓子,谁也不知道该怎么办

欧洲已经乱了阵脚,泽连斯基捅出这么大篓子,谁也不知道该怎么办

西楼知趣杂谈
2026-09-18 21:24:29
提出问题的人,又一次倒大霉了?

提出问题的人,又一次倒大霉了?

走读新生
2026-09-19 00:58:15
“多吃蛋白,少生病”,秋天多吃4种蛋白食物,增强体质,身体棒

“多吃蛋白,少生病”,秋天多吃4种蛋白食物,增强体质,身体棒

花小厨
2026-09-18 15:54:13
一针没打的280万人,2026年身体真相曝光

一针没打的280万人,2026年身体真相曝光

华庭讲美食
2026-08-26 01:21:08
南极传来两个消息,科学家集体沉默:人类的努力,正在失去意义

南极传来两个消息,科学家集体沉默:人类的努力,正在失去意义

小豫讲故事
2026-09-19 06:00:14
人能穷到什么地步?网友说他给130斤的富婆当过2个月男朋友,那味道比吃shi还恶心!

人能穷到什么地步?网友说他给130斤的富婆当过2个月男朋友,那味道比吃shi还恶心!

黯泉
2026-09-16 15:49:56
金球奖投票标准变了!凯恩、姆巴佩受益,哈兰德、亚马尔受影响

金球奖投票标准变了!凯恩、姆巴佩受益,哈兰德、亚马尔受影响

生活新鲜市
2026-09-19 00:19:20
10万亿!中国或将成为全球,乃至人类历史上,第一个“电力王国”

10万亿!中国或将成为全球,乃至人类历史上,第一个“电力王国”

福建睿平
2026-08-14 07:35:06
2026-09-19 10:15:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14023文章数 142733关注度
往期回顾 全部

科技要闻

直击iPhone 18新机发售:黄牛加价不如前代

头条要闻

牛弹琴:菲律宾南海挑事 在中国人无法忘记的特殊日子

头条要闻

牛弹琴:菲律宾南海挑事 在中国人无法忘记的特殊日子

体育要闻

好吧,中国男篮辛苦了

娱乐要闻

陈思诚 佟丽娅不想让儿子知道两人离婚

财经要闻

江西首富破产:一张927万商票压垮千亿帝国

汽车要闻

纯电/插混双动力+五座/六座双布局 海狮08应该怎么选?

态度原创

教育
数码
手机
亲子
本地

教育要闻

学校不是“无限责任公司”——给校长的校园安全责任地图与操作清单

数码要闻

显存4GB起步!暴雪《魔兽世界:Forever》最新硬件要求:GTX 10系列成门槛

手机要闻

特努斯:iPhone Duo是贯彻乔布斯“融合技术和人文”的绝佳体现

亲子要闻

秋季这么运动,娃身高还能窜一窜!

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

无障碍浏览 进入关怀版