智猩猩AI整理
编辑:BugMaker、林夕、没方
GPT-6 Astra的架构,可能已经被字节提前验证了
最近,围绕OpenAI下一代模型Astra的讨论中,一个关键词频繁出现:Looped Transformer。
![]()
简单来说,这是一种让模型反复计算的架构思路,不再一直增加Transformer层数,转向让同一组参数循环执行多次,以更少的参数换取更深的计算。
与此同时,一篇来自清华大学与字节Seed研究团队的论文《SMELT:Scaling Laws for Compute-Matched MoE Looped Transformers》,也把目光投向了这条路线。
这篇论文直接把FLOPs、参数量、KV Cache全部拉齐,不给Looped Transformer任何额外的计算和存储优势。实验结果表明,Looped Transformer依然展现出明显的Scaling优势,并且随着模型规模扩大,优势还在持续放大。
论文发布后,海外AI研究者Lisan Al Gaib转发论文作者Shaowen Wang的推文并评论:字节Seed研究实验室被严重低估了。
![]()
01
Transformer不一定需要更多层,
重复利用也能提升能力
传统Transformer模型通常采用“每层不同参数”的设计。例如,一个24层模型需要24组不同的Transformer层参数。
而 Looped Transformer 采用另一种方式,让部分已有层再次运行,相当于让模型对同一段计算进行第二次处理。这种方式可以增加模型的有效深度,但不会同步增加参数数量。
过去研究已经发现,循环结构在数学推理、算法学习等任务中具有潜力,但问题也很明显。
如果一个12层模型将全部层循环一次,实际计算量会接近24层模型,因此此前很多实验无法判断模型提升究竟来自循环结构,还是来自额外计算。
SMELT正是针对这个问题展开研究。
团队认为,公平比较两个模型,需要同时匹配三个指标。
其中包括模型计算量、决定模型容量的参数规模,以及影响长上下文效率的KV缓存占用。
只有这些条件接近,才能真正比较架构差异。
![]()
为了实现这种公平比较,研究团队选择了混合专家模型(Mixture-of-Experts,MoE)作为基础架构。
原因在于,MoE模型可以把参数规模和实际计算量分离。模型可以降低隐藏维度减少计算,再通过增加专家数量恢复参数容量。
最终,SMELT的核心设计是让Transformer中间约一半层循环两次,同时保持计算量、参数量和KV缓存规模基本一致。
02
中间层循环两次成为最佳方案,SMELT
扩展到54B规模依然有效
确定整体方向后,研究团队进一步探索了两个问题:哪些层适合循环,以及循环次数是否越多越好。
实验结果显示,相比让整个Transformer全部循环,循环中间区域效果更好。
原因在于Transformer不同位置承担不同功能,靠前层更多负责基础信息处理,靠后层更接近输出生成,而中间层承担更复杂的信息转换,因此重复利用收益最高。
最终,SMELT选择循环模型中间50%的层。
同时,循环次数也不是越多越好。如果循环3次甚至4次,为了保持计算预算不变,模型必须进一步缩小宽度,导致能力下降。
因此,循环两次成为最佳选择。
在这一基础上,研究团队将SMELT扩展到不同规模模型。实验覆盖100M、200M、600M以及1.6B活动参数规模,并进一步扩展验证到最大54B非Embedding参数规模。
结果显示,在测试规模和不同稀疏设置下,SMELT训练损失整体低于普通MoE Transformer。
![]()
更关键的是,团队进一步拟合了类似Chinchilla的缩放定律(Scaling Law)。
结果显示,在达到相同模型效果时,SMELT需要更少训练计算。
在不同计算预算下,SMELT可以节省6.8%—18.0%的训练计算量(FLOPs)。
这意味着未来训练大型语言模型时,除了扩大规模之外,重新设计计算方式也可能成为降低成本的重要方向。
03
第二次计算不是简单重复,
而是在重新调整注意力
为什么SMELT能够提升效果?研究团队进一步分析模型内部运行过程后发现,第二次经过循环层时,模型并不是简单复制第一次结果,而是在已有表示基础上进一步优化。
其中一个重要现象与注意力汇聚(Attention Sink)有关。
在Transformer中,模型经常会将大量注意力集中到序列开头Token。这些位置本身并不一定包含重要语义,却可能吸收大量注意力权重。
SMELT发现,循环层第二次执行后,模型会减少对这些位置的过度关注。
在Dyck语言匹配实验中,第一次计算时,模型大量关注BOS位置。
第二次计算后,注意力开始转向真正有价值的示例答案区域。具体来看,BOS位置(序列开始符)的注意力权重从0.60下降到0.02。示例答案Token获得的注意力从0.24提升到0.85。
![]()
研究团队认为,循环计算更像一次“模型自我修正”。
第一次执行帮助模型建立初步信息检索方向。第二次执行利用更新后的状态,让注意力重新分配。这也是为什么循环结构在需要复杂信息整合的任务中表现更明显。
04
长文本和上下文学习中优势扩大,
SMELT展现循环架构潜力
SMELT还表现出一个明显趋势,输入越长,收益越大。研究团队按照样本长度进行分析发现,在512到4096 Token长度的文本中,SMELT带来的收益约是短文本的1.52倍。
这说明循环结构可能更适合处理需要长期依赖的信息。
![]()
同时,在上下文学习(In-Context Learning,ICL)任务中,SMELT优势也进一步扩大。
当输入包含更多示例时,第二次计算能够帮助模型进一步提取其中规律。
在Dyck Languages任务中,提供32个示例时,SMELT准确率达到29.8%。Baseline准确率为26.4%。
![]()
过去,大模型优化主要围绕扩大参数、增加数据和提升算力展开。
而SMELT提供了另一种思路。
不一定需要更多参数,也可以通过更有效利用已有计算提升模型能力。
未来,随着大模型训练成本持续增长,如何让每一次计算产生更高价值,可能会成为下一阶段模型架构探索的重要方向。
关注+星标,获取AI前沿进展与开源一线动态
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.