网易首页 > 网易号 > 正文 申请入驻

GPT-6带火循环Transformer,阿里早已布局

0
分享至

GPT-6 Astra一发布,recurrent depth突然一夜火了!

最早是The Information爆料,Astra使用了这种「循环深度」技术:

让同一组Transformer层反复运行,在不增加同等规模参数的情况下,把计算做得更深

??模型不必继续疯狂「长肉」,也能让现有参数多干几轮活,还有这好事。



不出所料,争议很快到来。。。

由于循环发生在hidden state里,中间过程未必会写成人类可读的思维链,模型会不会因此更难监测?

OpenAI也由此被AI安全专家集体讨伐,甚至一度逼得首席科学家Jakub Pachocki亲自下场回应。

Jakub Pachocki还透露,自己正在憋一篇小作文以完整解释整件事情。



边等小作文,边让我们把目光拉回循环Transformer本身:

多循环几圈,模型真的就会更强吗?

学界其实早已踩坑。

同等算力下,省了参数的循环模型,经常打不过普通Transformer。

卡住它的,是一个相当现实的问题:

「计算冗余」

有意思的是,阿里早在11个月前就发了相关论文,靶子正是直指这个问题。

一篇MeSH,解决循环内部怎么管理信息,向行业老大难「循环空转」发起冲击。

一篇SpiralFormer,死磕循环之间「以什么精度计算」的粒度问题,让每一轮算力都花在刀刃上。

下一代架构候选,先过「计算冗余」这关

循环Transformer之所以让大家上头,是因为它给大模型提供了一种新的「变强方式」。

过去Scaling靠堆参数,24层就得24套参数,现在8层参数跑3遍,也能完成24层深度的计算。

效果能不能追上,还需要实验说话,但需要存储的参数确实少了。

用计算深度换参数规模,这笔账要是算得过来,想象空间可就大了

其实在Astra之前,Claude Mythos就曾把循环架构带火过一轮。

当时最抓眼球的,是一项图搜索成绩。

在GraphWalks BFS的256K至1M上下文测试中,Mythos Preview拿到了80.0%,GPT-5.4是21.4%,自家的Opus 4.6则是38.7%。

Mythos Preview得分接近GPT-5.4的四倍。



这个测试,可以理解成给模型一张复杂的关系网,让它从起点出发,一层层找出相连的节点。

找到一批,记住结果,再继续往下找,很考验连续多步处理信息的能力。

巧的是,循环架构擅长的,恰恰也是在hidden state里连续处理多轮信息。

于是Mythos的成绩一出来,外界很快便把两者联系到了一起。

至于它到底有没有采用循环架构,官方没有明说,答案也就留给了外界猜测。

不过从Mythos到Astra,大家期待的其实是同一件事:

模型不用一直长大,也能靠内部多算几轮,把能力提上去

这也让循环架构成为下一代高效大模型的候选路线之一。

不过问题来了,多算几轮,和多算出点东西,还真是两回事!!

看看这张图就明白了。

横轴从左到右,是信息经过模型各个模块的过程,中间三个蓝色柱子对应三次核心循环,也就是core loop。

纵轴表示计算前后hidden state的相对变化幅度。



第一个core loop更新很大,后面两个却迅速缩小。

注意,柱子变矮,并不意味着模型少花了算力,矩阵运算和Attention照样要跑。

这正是计算冗余的尴尬:

循环次数增加了,后续计算带来的增量却越来越小

来自阿里及合作高校的研究团队,正是从这里入手一路深挖。

他们先查清循环为什么空转,再想办法让后面几轮真正干上活。

MeSH:同时解决「计算无分化」和「信息过载」

团队首先给出的解法叫MeSH,现已被ICLR 2026接收。

论文首版在2025年10月公开,等于11个月前,他们就在给循环Transformer做「体检」了。



论文拉到底,先看效果。

在Pythia-1.4B级别的实验中,循环结构通过权重共享,减少了约33%的非嵌入参数。加入MeSH后,零样本下游平均准确率反而从普通Transformer的49.50%提高到50.56%,领先1.06个百分点

少了三分之一的非嵌入参数,成绩反而更好。

而MeSH新增的路由器参数,仅相当于普通Transformer非嵌入参数的约0.005%。

相较基础循环模型,额外计算开销也只有约0.014%,属于花小钱,办大事。



MeSH是怎么做到的?

团队直接钻进模型内部,检查模型每一轮到底干了什么,结果一下子找到了三个「摸鱼证据」。

第一个证据,是后面的循环越来越不爱动

团队比较了hidden state经过每轮计算前后的变化幅度,结果发现第一个core loop承担了绝大部分更新,到了后面几个core loop,状态变化迅速缩小。

第二个证据,是前后几轮越来越像

团队使用CKA分析不同循环之间的表示相似度,然后发现相邻轮次的hidden state高度接近。

同一组网络转了一圈又一圈,吐出来的东西却差不多,啊这!!

更扎心的是,第三个证据显示hidden state还越算越「单一」

奇异值谱分析显示,循环进行之后,模型表示逐渐挤进一个低维空间。

原本可以从多个方向表达的信息,被压缩到少数几个方向上,表达越来越单一。

三个证据摆在一起,模型的摸鱼套路就很清楚了:

第一个core loop猛干,后面几个core loop合着纯纯陪跑。



为什么会这样?这篇论文给出了两个诊断。

一个是「计算无分化」。同一组网络反复使用,又缺少明确的轮次信息,很难在不同阶段形成分工,容易沿用相似的计算方式。

另一个是「信息过载」。同一份hidden state既要保存原始输入,又要装下前几轮结果,还得承担当前计算。长期记忆和临时加工全挤在一起,最后谁也干不好。

说到底,得重新研究循环之间怎么「交接工作」。

传统循环模型里,上一轮算完,直接把hidden state整份递给下一轮,再由同一组网络接着算。

虽然后来大家打过补丁,怕它算着算着忘了原题,就把最初的状态重新加回来,但不管算到第几轮、当前处理哪个token,信息的搭配规则都是写死的。

MeSH想了一招:

不如干脆给模型加一个可以动态存取的「资料柜」?

这个资料柜叫Memory Buffer,由多个记忆槽组成,用来保存原始输入和循环过程中积累的信息,不必全部挤在当前hidden state里。

接着,MeSH给资料柜配了两个管理员。

  • 一个是Write Router,负责决定这一轮的新结果,应该按什么权重分摊到各个记忆槽。
  • 另一个是Read Router,负责在下一轮开始前,按不同权重读取各个槽位,重新组合成新的hidden state。



而且,这些管理员各有各的工作方式。

每轮循环都有自己的路由器,每个token也能得到不同的读写权重。

新信息各存多少,历史信息各取多少,都由模型自己学习。

看到这里,关注过前段时间Hyper-Connections、mHC讨论的朋友,可能已经有点眼熟了。

它们在计算形式上,确实有相似之处

Hyper-Connections把原先单路传递的残差信息扩展成多路,再通过可学习的映射,组合出交给计算层的输入,并把计算结果分配回多路状态。mHC进一步约束这些连接,改善深层传播的稳定性。

MeSH则把类似的信息调配方式用在循环之间,同时缓解了前面两个问题:

Memory Buffer把历史信息分流出去,hidden state终于能专心处理当前轮次。

动态读写路由器则为每轮搭配不同的信息,让共享网络逐渐形成分工,减少重复劳动。

这时候再用同样的三项指标重新检查,模型摸鱼时呈现的三个症状,果然都有了明显改善。



不过,循环之间有了分工,还有一件事没变:

每一轮依然要在完整token序列上计算

这就像明明只想先看清一座城市的整体布局,却还是得沿着每条街挨家挨户走上一遍。

信息会分工了,计算的尺度却还是固定的。

这就轮到第二篇论文SpiralFormer登台了。

SpiralFormer:让每一轮看不同尺度的世界

这篇论文继续往下追问:

既然不同循环可以处理不同信息,为什么还要让每一轮都盯着完整的token序列?

SpiralFormer给出的答案,是把每轮循环的序列长度seq_len也变成可调的。这一成果刚被EMNLP 2026接收。

简单来说,他们受Coconut等隐式思考工作的启发,意识到模型中间的「思考」并不一定每一步都要维持完整、显式的token序列,也可以先压缩成更紧凑的表示,在潜空间中继续计算。



将相关思路运用到SpiralFormer里,效果居然还不错。

在Pythia-1.4B级别的实验中,SpiralFormer-L和普通Transformer的参数量基本相同,计算量却从14.08T FLOPs降到13.13T,5-shot下游平均准确率则从51.93%提高到54.37%

算得更少,成绩反而更高。



具体思路是,别让模型每一轮都用同样的分辨率看问题

它会先把相邻token压缩成更短的序列,再按照从粗到细的顺序循环。

论文采用的一种典型方案,是先从原序列的1/8长度开始,之后依次扩展到1/4、1/2,最后回到完整序列。

举个例子,这就像看地图。

第一轮先看城市全貌,弄清不同区域之间的关系,然后逐步放大,看到街区和道路,最后再落到具体位置。



回到论文就是,SpiralFormer在每轮循环开始前,都会对序列做一次「缩放」:

把相邻token划成一组,通过可学习的权重聚合成一个更粗的表示。压缩完的序列更短,Attention要算的token少了,计算量自然往下掉。

算完之后,再把结果分配回原来的token位置,交给下一轮继续处理。

这里需要注意,考虑到模型生成文本时不能偷看后面的内容,SpiralFormer还对写回结果做了右移,避免压缩操作泄露未来信息。

就这样,压缩、计算、还原……

每循环一轮,序列分辨率就提高一级,模型也从观察整体逐渐转向处理细节。



不过这里还有一个疑问:

这套「先看全局、再抠细节」的说法,到底只是设计者的一厢情愿,还是模型真的学会了?

团队接着钻进Attention里,做了两项probing实验。

先是观察Attention看得有多散

结果显示,早期的低分辨率循环中,注意力分布得更广,会同时关注较大范围的信息,而到了后期的高分辨率循环,注意力开始集中到少数关键位置。

然后直接检查Attention有多关注附近的token

随着分辨率提高,他们发现落在局部范围内的注意力越来越多。

也就是说,模型到了后面几轮,确实更倾向于处理局部关系。

这也就引出了SpiralFormer的核心发现:

循环初期建立global pattern,随着循环推进,再逐渐转向local pattern

相比之下,始终处理完整token序列的普通LoopedFormer,虽然也会出现类似变化,但趋势更弱,也不够稳定。

这说明,从全局到局部的分工并不会随着循环自动出现,多分辨率设计才是关键驱动因素。



团队还保持参数量和训练计算预算不变,只调整循环层所占的比例。

结果形成了一条U形曲线

随着循环比例提高,模型表现先变好,在30%到40%左右达到最佳,继续增加循环,过度共享参数又会拖累效果。



SpiralFormer也由此打开了另一个可以探索的Scaling维度:

除了循环多少次,还能调整每轮把序列压缩到什么尺度

一篇管信息,一篇管尺度

回头再看,这两篇论文其实补上了循环Transformer最缺的东西:

没错,正是分工!!

MeSH解决每轮「拿什么算」,SpiralFormer解决每轮「以什么粒度算」。

两块拼起来,也让循环架构走向下一代高效LLM,多了几分底气。

过去大模型要想Scaling,主要靠参数、数据和训练算力这三大支柱。推理模型兴起后,又多了一种做法,即让模型生成更长的思维链,用更多token换更好的答案。

现在呢?循环Transformer又提供了一种选择:

计算可以在hidden state里继续进行,同一组参数反复使用,模型规模可以不变,内部计算却能一层层加深

虽然这并不意味着可以白捡算力,毕竟循环结构省下的是参数,不是计算。

但只要让多出来的每一轮都算得值,用更少的参数撑起更强的模型,就有了可能。



这也是MeSH和SpiralFormer存在的意义,它们正是在把这种可能一步步做实。

围绕Astra和Mythos,外界还在热议「到底有没有用循环架构」「这会不会成为下一代路线」。

而阿里及合作高校团队已经把问题拆到了循环内部:

从查病因,到改结构,再到验证效果,这条路线上的具体卡点,就这样被逐个拆开了

MeSH获ICLR 2026接收,SpiralFormer获EMNLP 2026接收,顶会的认可也算是给这番持续深挖增加了更多含金量。

只能说,为了走到今天这一步,前人已经在这条路上踩了不少坑,也填了不少坑。

早在2018年的Universal Transformer中,研究者就开始尝试反复使用共享层。

近几年,Looped Transformer、recurrent depth和latent reasoning等研究又陆续出现,背后都是同一个念头:

模型想变强,除了继续长大,能不能也让现有参数多想几轮?

Astra的出现,更是把这条原本偏学术的路线,一把推到了行业聚光灯下。

至于下一代高效大模型会不会从这里长出来,现在下结论确实还有点早。

那就,让子弹再飞一会儿吧。

MeSH:https://arxiv.org/abs/2510.07739
SpiralFormer: https://arxiv.org/abs/2602.11698

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
武大举报风波升级!终于查实:付磊教授的原配妻子为汪海英,曾任该校的行政干部

武大举报风波升级!终于查实:付磊教授的原配妻子为汪海英,曾任该校的行政干部

火山詩话
2026-09-05 17:49:34
路边碰到一群精神小妹,我想知道他们的出路在哪

路边碰到一群精神小妹,我想知道他们的出路在哪

皮蛋儿电影
2026-09-05 16:09:44
科大讯飞出轨女主朱倩旧照疑曝光!小眼睛大脸盘,身材一般,和网传照片天差地别

科大讯飞出轨女主朱倩旧照疑曝光!小眼睛大脸盘,身材一般,和网传照片天差地别

小徐讲八卦
2026-09-03 11:53:43
银行行长酒后漏嘴:六十岁以后存钱,一定别全部存在个人名下

银行行长酒后漏嘴:六十岁以后存钱,一定别全部存在个人名下

奇思妙想生活家
2026-09-05 11:27:06
突发!伊朗导弹袭击美航母

突发!伊朗导弹袭击美航母

极目新闻
2026-09-06 10:12:33
怒了!挥拳砸向张宁!CBA夏联第一激烈冲突

怒了!挥拳砸向张宁!CBA夏联第一激烈冲突

篮球实战宝典
2026-09-05 19:22:03
从星宇劳动纠纷来看,为什么我国很多企业都不遵守劳动法

从星宇劳动纠纷来看,为什么我国很多企业都不遵守劳动法

娱乐圈见解说
2026-09-06 07:07:54
42岁文章带32岁新女友看话剧,素颜似32岁时的姚笛?网友:还是50岁马伊琍最漂亮

42岁文章带32岁新女友看话剧,素颜似32岁时的姚笛?网友:还是50岁马伊琍最漂亮

奴染
2026-09-02 23:58:15
利好!中国女排提前锁定世界杯种子席位 前三名获奥运会参赛资格

利好!中国女排提前锁定世界杯种子席位 前三名获奥运会参赛资格

念洲
2026-09-06 07:38:17
前澳网冠军回应被郑钦文逆转:恐慌煎熬!挥拍都放不开 不会打球

前澳网冠军回应被郑钦文逆转:恐慌煎熬!挥拍都放不开 不会打球

念洲
2026-09-06 06:29:45
年薪4160万!火箭7子薪资排名,阿门新合同小胜申京!1人已掉队

年薪4160万!火箭7子薪资排名,阿门新合同小胜申京!1人已掉队

熊哥爱篮球
2026-09-06 10:04:41
德国的强硬回击,让俄罗斯绷不住了

德国的强硬回击,让俄罗斯绷不住了

山河路口
2026-09-03 22:42:02
国安部:间谍深夜翻进快递站偷数据,值班人员及时发现举报;成功破获企图窃取我境内快递企业数据案件,细节披露

国安部:间谍深夜翻进快递站偷数据,值班人员及时发现举报;成功破获企图窃取我境内快递企业数据案件,细节披露

台州交通广播
2026-09-06 09:14:58
赖清德,有望成为新中国历史上,第一位任上出事的台湾地区领导人

赖清德,有望成为新中国历史上,第一位任上出事的台湾地区领导人

老脸科普君
2026-09-06 09:06:27
美网1/8决赛:郑钦文VS斯瓦泰克,冲523万奖金,第9次交手谁能赢

美网1/8决赛:郑钦文VS斯瓦泰克,冲523万奖金,第9次交手谁能赢

体育大学僧
2026-09-06 10:34:48
女性负债,真的开始“集中爆雷”了。

女性负债,真的开始“集中爆雷”了。

老陆不老
2026-09-04 21:51:34
舆论升级!苏州一厨师主动辞职、工资结清,转头索要5.4万社保赔偿,网友怒斥:这种过河拆桥的人,最终没有好下场的

舆论升级!苏州一厨师主动辞职、工资结清,转头索要5.4万社保赔偿,网友怒斥:这种过河拆桥的人,最终没有好下场的

火山詩话
2026-09-05 06:06:47
澳总理批中国导弹试射,被当场反问:美国67次核试验怎么不说?

澳总理批中国导弹试射,被当场反问:美国67次核试验怎么不说?

算力游侠
2026-09-05 09:11:31
4-1!39岁法布雷加斯太神了,率队登顶意甲,皇马8000万弃将破门

4-1!39岁法布雷加斯太神了,率队登顶意甲,皇马8000万弃将破门

球场没跑道
2026-09-05 13:37:48
“100%椰子水”大翻车!配料表仅有“椰子水” 却检出山梨酸及钾盐

“100%椰子水”大翻车!配料表仅有“椰子水” 却检出山梨酸及钾盐

闪电新闻
2026-09-05 11:21:22
2026-09-06 12:12:49
量子位 incentive-icons
量子位
追踪人工智能动态
13270文章数 176550关注度
往期回顾 全部

科技要闻

DeepSeek被曝将采购16万颗华为昇腾950DT

头条要闻

男子1.38万捡漏二手大众CC 懂车帝称操作失误未发货

头条要闻

男子1.38万捡漏二手大众CC 懂车帝称操作失误未发货

体育要闻

本西蒙斯加盟国王,不管怎样,回来就好

娱乐要闻

低调富养!郭富城两女儿入读香港名校

财经要闻

亏损高达200亿,昔日彩电霸主走下巅峰!

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

数码
本地
亲子
公开课
军事航空

数码要闻

狼蛛NOVA98系列机械键盘新增“桃雾粉”“尘雾白”上市

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

亲子要闻

揪心一幕:幼儿园开学,孩子哭闹、甚至逃跑,家长不舍地扒墙观望

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

突发!伊朗导弹袭击美航母

无障碍浏览 进入关怀版