网易首页 > 网易号 > 正文 申请入驻

硅谷炸锅!字节Seed押中OpenAI最强模型Scaling路线

0
分享至

智猩猩AI整理

编辑:BugMaker、林夕、没方

GPT-6 Astra的架构,可能已经被字节提前验证了

最近,围绕OpenAI下一代模型Astra的讨论中,一个关键词频繁出现:Looped Transformer


简单来说,这是一种让模型反复计算的架构思路,不再一直增加Transformer层数,转向让同一组参数循环执行多次,以更少的参数换取更深的计算。

与此同时,一篇来自清华大学与字节Seed研究团队的论文《SMELT:Scaling Laws for Compute-Matched MoE Looped Transformers》,也把目光投向了这条路线。

这篇论文直接把FLOPs、参数量、KV Cache全部拉齐,不给Looped Transformer任何额外的计算和存储优势。实验结果表明,Looped Transformer依然展现出明显的Scaling优势,并且随着模型规模扩大,优势还在持续放大

论文发布后,海外AI研究者Lisan Al Gaib转发论文作者Shaowen Wang的推文并评论:字节Seed研究实验室被严重低估了


01

Transformer不一定需要更多层,

重复利用也能提升能力

传统Transformer模型通常采用“每层不同参数”的设计。例如,一个24层模型需要24组不同的Transformer层参数。

而 Looped Transformer 采用另一种方式,让部分已有层再次运行,相当于让模型对同一段计算进行第二次处理。这种方式可以增加模型的有效深度,但不会同步增加参数数量。

过去研究已经发现,循环结构在数学推理、算法学习等任务中具有潜力,但问题也很明显。

如果一个12层模型将全部层循环一次,实际计算量会接近24层模型,因此此前很多实验无法判断模型提升究竟来自循环结构,还是来自额外计算。

SMELT正是针对这个问题展开研究。

团队认为,公平比较两个模型,需要同时匹配三个指标。

其中包括模型计算量、决定模型容量的参数规模,以及影响长上下文效率的KV缓存占用。

只有这些条件接近,才能真正比较架构差异。


为了实现这种公平比较,研究团队选择了混合专家模型(Mixture-of-Experts,MoE)作为基础架构。

原因在于,MoE模型可以把参数规模和实际计算量分离。模型可以降低隐藏维度减少计算,再通过增加专家数量恢复参数容量。

最终,SMELT的核心设计是让Transformer中间约一半层循环两次,同时保持计算量、参数量和KV缓存规模基本一致。

02

中间层循环两次成为最佳方案,SMELT

扩展到54B规模依然有效

确定整体方向后,研究团队进一步探索了两个问题:哪些层适合循环,以及循环次数是否越多越好。

实验结果显示,相比让整个Transformer全部循环,循环中间区域效果更好。

原因在于Transformer不同位置承担不同功能,靠前层更多负责基础信息处理,靠后层更接近输出生成,而中间层承担更复杂的信息转换,因此重复利用收益最高。

最终,SMELT选择循环模型中间50%的层。

同时,循环次数也不是越多越好。如果循环3次甚至4次,为了保持计算预算不变,模型必须进一步缩小宽度,导致能力下降。

因此,循环两次成为最佳选择。

在这一基础上,研究团队将SMELT扩展到不同规模模型。实验覆盖100M、200M、600M以及1.6B活动参数规模,并进一步扩展验证到最大54B非Embedding参数规模。

结果显示,在测试规模和不同稀疏设置下,SMELT训练损失整体低于普通MoE Transformer。


更关键的是,团队进一步拟合了类似Chinchilla的缩放定律(Scaling Law)

结果显示,在达到相同模型效果时,SMELT需要更少训练计算。

在不同计算预算下,SMELT可以节省6.8%—18.0%的训练计算量(FLOPs)。

这意味着未来训练大型语言模型时,除了扩大规模之外,重新设计计算方式也可能成为降低成本的重要方向。

03

第二次计算不是简单重复,

而是在重新调整注意力

为什么SMELT能够提升效果?研究团队进一步分析模型内部运行过程后发现,第二次经过循环层时,模型并不是简单复制第一次结果,而是在已有表示基础上进一步优化。

其中一个重要现象与注意力汇聚(Attention Sink)有关。

在Transformer中,模型经常会将大量注意力集中到序列开头Token。这些位置本身并不一定包含重要语义,却可能吸收大量注意力权重。

SMELT发现,循环层第二次执行后,模型会减少对这些位置的过度关注。

在Dyck语言匹配实验中,第一次计算时,模型大量关注BOS位置。

第二次计算后,注意力开始转向真正有价值的示例答案区域。具体来看,BOS位置(序列开始符)的注意力权重从0.60下降到0.02。示例答案Token获得的注意力从0.24提升到0.85。


研究团队认为,循环计算更像一次“模型自我修正”。

第一次执行帮助模型建立初步信息检索方向。第二次执行利用更新后的状态,让注意力重新分配。这也是为什么循环结构在需要复杂信息整合的任务中表现更明显。

04

长文本和上下文学习中优势扩大,

SMELT展现循环架构潜力

SMELT还表现出一个明显趋势,输入越长,收益越大。研究团队按照样本长度进行分析发现,在512到4096 Token长度的文本中,SMELT带来的收益约是短文本的1.52倍。

这说明循环结构可能更适合处理需要长期依赖的信息。


同时,在上下文学习(In-Context Learning,ICL)任务中,SMELT优势也进一步扩大。

当输入包含更多示例时,第二次计算能够帮助模型进一步提取其中规律。

在Dyck Languages任务中,提供32个示例时,SMELT准确率达到29.8%。Baseline准确率为26.4%。


过去,大模型优化主要围绕扩大参数、增加数据和提升算力展开。

而SMELT提供了另一种思路。

不一定需要更多参数,也可以通过更有效利用已有计算提升模型能力。

未来,随着大模型训练成本持续增长,如何让每一次计算产生更高价值,可能会成为下一阶段模型架构探索的重要方向。

关注+星标,获取AI前沿进展与开源一线动态

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
火箭官宣签下阿门!五年2.08亿细节出炉 斯通今夏完美7运作造14+3名单

火箭官宣签下阿门!五年2.08亿细节出炉 斯通今夏完美7运作造14+3名单

颜小白的篮球梦
2026-09-04 06:19:09
全面遏华开始?委政府接到消息,禁止用新油抵债,中方借款出变故

全面遏华开始?委政府接到消息,禁止用新油抵债,中方借款出变故

影孖看世界
2026-09-03 23:39:31
别把“告洋状”的帽子扣在107名维权的孩子头上

别把“告洋状”的帽子扣在107名维权的孩子头上

迷世书童
2026-09-03 22:53:51
5年2.3亿美金,成NBA尴尬的状元,你可能要被交易

5年2.3亿美金,成NBA尴尬的状元,你可能要被交易

篮球扫地僧
2026-09-04 00:06:28
斯诺克最新战报 中国2人进八强 龙泽煌范争一晋级 赵心童对手较弱

斯诺克最新战报 中国2人进八强 龙泽煌范争一晋级 赵心童对手较弱

千山暮雪h
2026-09-04 02:18:40
法国人吐槽坐中国高铁被歧视!唯独他被抽查,工作人员还扬言爱投诉就投诉,评论区十分团结

法国人吐槽坐中国高铁被歧视!唯独他被抽查,工作人员还扬言爱投诉就投诉,评论区十分团结

谭谈社会
2026-09-03 20:26:28
特斯拉新车续航公布!外观太低调了

特斯拉新车续航公布!外观太低调了

花果科技
2026-09-03 23:04:07
镇领导多次自掏腰包买苗送村民?涉事村民称镇政府公号文章内容不实;当地回应:系概括性文学加工表述

镇领导多次自掏腰包买苗送村民?涉事村民称镇政府公号文章内容不实;当地回应:系概括性文学加工表述

大风新闻
2026-09-02 21:47:05
重回前100名!郑钦文杀疯了!2-1强势挺进32强,将对阵澳网冠军

重回前100名!郑钦文杀疯了!2-1强势挺进32强,将对阵澳网冠军

搏击江湖
2026-09-04 06:23:14
日元没救了,日本更没救了

日元没救了,日本更没救了

云石
2026-09-03 11:51:15
退休返聘迎来严查!最高罚20万、直接清退,这三个大坑避开

退休返聘迎来严查!最高罚20万、直接清退,这三个大坑避开

天气观察站
2026-09-03 08:35:50
玩家把PS5挂墙上炫耀:被网友喷 "蠢出天际"

玩家把PS5挂墙上炫耀:被网友喷 "蠢出天际"

游民星空
2026-09-02 16:11:52
美记分析火箭双线并行:不是夺冠球队!明夏续约谢泼德+KD球选更难

美记分析火箭双线并行:不是夺冠球队!明夏续约谢泼德+KD球选更难

颜小白的篮球梦
2026-09-04 07:03:57
当年是谁把救死扶伤的医院“扔”进市场的?答案不在医生身上

当年是谁把救死扶伤的医院“扔”进市场的?答案不在医生身上

健身狂人
2026-09-03 10:04:18
为啥我们5次申请CPTPP都失败,谁在阻拦?

为啥我们5次申请CPTPP都失败,谁在阻拦?

辛苦的啊欣啊
2026-07-12 05:40:45
哪怕你正蹲厕所,也把这条看完!这6件事没人告诉你,但能保命

哪怕你正蹲厕所,也把这条看完!这6件事没人告诉你,但能保命

小鹿姐姐情感说
2026-09-03 07:55:52
黄仁勋发文,宣布以877亿收购全球最大AI开源平台

黄仁勋发文,宣布以877亿收购全球最大AI开源平台

DoNews
2026-09-03 21:43:16
今夜,全线大涨

今夜,全线大涨

中国基金报
2026-09-04 00:58:11
还没出道就火了!神似宋威龙北电新生报到引围观

还没出道就火了!神似宋威龙北电新生报到引围观

大眼妹妹
2026-09-04 06:29:21
美国8月综合PMI为56

美国8月综合PMI为56

每日经济新闻
2026-09-03 21:58:05
2026-09-04 07:15:00
智猩猩
智猩猩
AI 技术内容与服务平台
56文章数 2关注度
往期回顾 全部

科技要闻

英伟达129亿美元拿下Hugging Face

头条要闻

男子逛夜市遭按摩摊大妈拉住 被5个大妈服务按到发红

头条要闻

男子逛夜市遭按摩摊大妈拉住 被5个大妈服务按到发红

体育要闻

梅西:巴萨10号与阿根廷10号

娱乐要闻

王宝强携女友回工作室!相恋8年仍未婚

财经要闻

章子怡套现3亿 上美拿什么补韩束的缺?

汽车要闻

限时权益价28.99万起 FREELANDER神行者8正式上市

态度原创

游戏
艺术
旅游
公开课
军事航空

《食人鲨2》正式公布!新预告亮相 2027年发售

艺术要闻

放大《汉宫春晓图》:撕掉宫斗剧滤镜,这才是明代深宫女子的真实日常

旅游要闻

巴黎自行车旅游升温,多家公司推出特色骑行线路   新民侨梁

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

乌特工内战街头对射 互认对方为"俄特工"

无障碍浏览 进入关怀版