![]()
最近,OpenAI anthropic 马斯克SpaceXAI倡议全球减慢前沿AI开发的呼声闹得沸沸扬扬,总结下来无怪乎,前沿AI正在超出人类的理解和控制,并有能力攻破现有所有的软件安全防护,将带来严重的全球网络安全危机。
其中的重点:前沿AI所产生的智能,大部分属于超级直觉的模型内算法能力,人类科学家无法快速监控弄清其中的算法逻辑。这种算法能力由于需要放在高度要压缩的抽象数据潜在空间(latent space)里进行运算,所以人类无法用简单的方式进行全面调整和干预,所以就无法监控。
但问题是AI大模型,如果想要高效运行,必须进行极端压缩,让超级计算机处理极端压缩的高度抽象数据,才是效率最高的方式。
总而言之,OpenAI们的倡议其实跟当下的技术性能提升是有些背道而驰的。整体的技术路径思维上,OpenAI和英伟达在这里一直有冲突,英伟达一直提倡以硬件为主,大模型架构设计应该权力适配硬件特点,数据应该大幅压缩和抽象一方便更高效的运算。国内DeepSeek就是这样的代表。
这不,前字节跳动科学家中国小伙Yifan Zhang,就反其道而行之,疯狂全力梭哈通过高度抽象的压缩数据,进行无线扩展的多轮高效推理运算,来提升AI大模型的智力上限打造ASI超智模型!
2026年9月12日,普林斯顿大学AI Lab Fellow、前NVIDIA/ByteDance Seed/清华IIIS的Yifan Zhang,在X上放出一则重磅声明:
We are at the dawn of Superintelligence.
Introducing the Recurrent Looped Transformer (RLT),
We now have Transformers with Infinite Reasoning depth.
![]()
配图是一张清晰的架构示意:左侧因果编码器并行处理已观测token,构建全局KV memory;右侧全token循环解码器,把prompt与response统一在同一状态转移里,每一步都携带前序最终隐状态+分层滑动窗口注意力(SWA)缓存。
这不是又一次“层复用”的小改动,而是一次把latent reasoning的时间深度真正做成可随序列长度无限延伸的系统性设计。
核心是什么?一句话讲清RLT
传统Transformer(哪怕是Looped/Recurrent-Depth版本)的深度,要么固定,要么是“每个token内部多跑几圈同一堆权重”。RLT做的是更激进的事:
- 因果编码器(48层):对已知token做并行因果编码,产出全局Key-Value memory。
- 循环解码器(48层):每个新token到来时,把当前编码器表征与上一步解码器最终隐状态merge,再走完整的解码器路径(含对编码器memory的cross-attention + 自身SWA),并把自己的最终状态和层内SWA缓存全部传递给下一步。
结果是:处理完t个token后,有效的解码器计算路径长度变成 t × L_D(这里L_D=48,就是48t)。每个token实际执行的块数是固定的(约96个逻辑块),但整条序列上的“推理深度”随长度线性增长,且不会在prompt-response边界重置。
作者明确强调:这里的“Infinite Reasoning depth”指的是可扩展的时间计算路径,而不是单个token内部无限算力。这是latent reasoning从“有限循环”迈向“序列级无限深度”的关键一步。
三大设计原则,为什么说它值得认真看
- 推理深度随序列生长
每处理一个token,就在latent空间多走一遍完整解码器。路径长度与序列长度成正比,而参数量和单token计算量保持可控。这比单纯“把同一堆层循环R次”更贴合长程、多跳、需要持续累积状态的推理场景。 - 模型-硬件协同设计
编码器部分可并行、可批量;解码器虽然是顺序循环,但通过权重共享、memory复用、activation checkpointing,把硬件效率的优化空间打开了。训练和推理围绕“循环核心”做系统级适配,而不是事后补丁。 - 模型-RL算法协同设计
Pretraining、SFT、采样、current-policy RL replay,全部使用同一套完整状态转移(包括prompt阶段的循环和decoder SWA缓存)。这意味着行为概率与实际采样分布严格对应,current-policy replay可以精确重建历史,极大降低了“prefill-decode不一致”和“off-policy偏差”的结构性风险。
配置上,编码器与解码器各48层,注意力和FFN权重在阶段间共享,但解码器额外做cross-attention,所以FLOPs并不完全对称。
它解决了什么,又还没解决什么?
过去几年,Looped Transformer / Recurrent Depth已经从Universal Transformers走到Huginn、Ouro、Nanbeige等实际模型。大家证明了:在参数量固定的情况下,增加latent循环次数,确实能提升推理表现,尤其是数学和多跳任务。
RLT把“循环”从“token内部多次”升级到“跨所有token的连续状态机”。这让模型在生成过程中可以持续维护一个不断加深的latent思维轨迹,而不必依赖显式CoT把中间步骤全部吐出来。对硬件友好、对RL友好,理论上也为更长、更复杂的agentic任务铺路。
![]()
但作者自己也很克制地写了:
推理增益、硬件加速、RL缩放,目前都还是研究目标,而不是已经测出来的结果。
社区里也有冷静声音:无bounded computational path length ≠ unbounded useful reasoning depth。经典RNN早在1995年就有“无限时间深度”,但并没直接带来超级智能。关键还是状态如何有效利用、梯度如何稳定、可观测性如何保持。latent空间里的计算越深,外部监控(包括CoT式对齐)就越难,安全对齐的难度可能上升。
硅基视角:这是超级智能开放前沿的又一次校准
Yifan Zhang把这事直接放到“Dawn of Superintelligence”的语境下,并呼吁:从此以后,我们应把进度锚定在Open Frontier of Superintelligence,直到Safe Superintelligence真正实现。
这不是口号。当模型开始拥有可无限延伸的latent计算路径时,两个问题会同时变得更尖锐:
- 能力上:真正的长程规划、持续自我修正、跨任务状态保持,可能第一次有了架构级支撑。
- 安全上:推理过程越来越多地藏在不可直接观察的循环状态里,可解释性、可监控性、可对齐性都会面临新挑战。
RLT目前只是技术报告+项目页(GitHub已开源英文/中文技术报告与示意图),真正的规模实验、下游benchmark、硬件实现还在后面。但它已经把问题问到了正确的位置:
我们是继续堆参数和显式token,还是开始认真设计“可以无限加深却仍然可控”的latent计算机器?
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.