网易首页 > 网易号 > 正文 申请入驻

彻底改写Transformer!「能量驱动架构」横空出世,通用推理时代要来了?

0
分享至

新智元报道

编辑:海狸

【新智元导读】UIUC、斯坦福与哈佛联合提出全新「能量驱动Transformer(EBT)」架构,突破传统前馈推理方式,以能量最小化模拟人类System 2思维,预训练扩展性能较Transformer++最高提升35%。下一代AI基础架构新变革,来了!

在Transformer统治AI世界十余年之后,

Attention的时代正在退场,真正的思考刚刚开始——

由UIUC、斯坦福、哈佛等顶尖机构联合提出的Energy-Based Transformer(EBT)震撼登场。

它首次将Transformer架构引入能量建模(Energy-Based Models, EBM)框架,彻底打破「前馈即推理」的旧范式。

论文链接:https://arxiv.org/pdf/2507.02092

EBT既不是轻量化微调,也不是RNN的改进,而是一种彻底不同的推理机制:

模型不再一次性「说完答案」,而是像人类一样从模糊猜测出发,逐步优化推理路径。

EBT训练更高效,推理更精准,对OOD(Out of Distribution)数据更稳健,在训练效率、提升幅度等方面大幅超越前馈式Transformer(Transformer++):

并且,EBT在文本与图像等多模态任务中展现出惊人的扩展性能,有望实现无监督跨模态通用推理。

「一次生成」vs「动态优化」

传统Transformer是一种典型的「前馈预测器」,每次推理过程都是按照从输入prompt,到固定的前向传播路径,再到输出结果一次完成的。

无论问题简单还是复杂,模型都以固定的计算路径和步骤完成推理,无法因难度灵活调整。

每个token都只做一次决策,不进行「反悔」或者「修改」。

这就像一个学生答题时,只能「一遍写完不许改」。

在这种模式下,模型既不能「检查答案」,也无法「修正思路」,更谈不上「深入思考」。

而EBT彻底颠覆了这种机制。

EBT对每个预测都进行多轮优化:

  • 不直接输出token,从随机初始预测开始

  • 模型计算该预测与上下文的「能量值」(兼容性高对应能量低,兼容性差对应能量高)

  • 通过对能量的梯度下降,不断更新预测,逐步将其「调得更合适」

这个过程会持续多轮,直到能量收敛,也就是模型认为这个预测「足够合理」了。

这样EBT最后得到的每个token都是动态计算、多步修正的产物,像在能量地形图中「下山」一样逐步收敛到最优答案。

也就是说,模型的「思考」被建模成了一个小型优化任务,不是一遍完全输出答案,而是反复尝试—验证—更新—收敛。

这个「能量最小化」的过程就是EBT前所未有的System 2 Thinking——更慢,更准,更通用的类人深度思考能力。

EBT「三大跃迁」

EBT的思考过程赋予了它三项关键能力上的根本性突破。

态计算

传统Transformer模型是静态的:每个token、每个预测都使用固定的计算路径和深度,无论问题简单还是复杂,计算量一视同仁。

而EBT拥有动态计算资源分配能力,可以像人一样,遇到简单问题快速处理,遇到困难问题则投入更多思考。

换句话说,EBT可以动态决定要「多想几步」还是「快速收敛」。

不确定度

而且,EBT预测能量的设计决定了它可以在连续空间中表达不确定性。

Transformer虽然能在离散的token输出中使用softmax表示「概率分布」,但在图像、视频等连续 模态中就很难表达不确定性。

EBT预测上下文之间的能量建模,自然地通过能量高低表达了预测的「可信程度」。

这种能力让EBT 能在图像、 视频 等连续任务中识别哪些位置「值得多想」。

自我验证

在能量分数的加持下,EBT天生具备显式的自我验证能力。

每次预测,它都会计算衡量上下文匹配程度的「能量分数」。

这个分数不仅可以用来判断答案是否靠谱,而且可以生成多个候选答案,并挑出能量最低的答案作为最终结果。

这种机制彻底摆脱了对外部打分器或奖励函数的依赖,将「反思」环节引入了模型结构本身。

相比之下,传统架构在「思考能力」上几乎全面溃败。

无论是Feed Forward Transformer还是RNN,都缺乏动态计算分配能力、无法建模连续空间中的不确定性,更谈不上对预测结果进行验证。

就连在生成模型中备受追捧的Diffusion Transformer,也仅在“动态计算”这一项上有所突破,其余两项依然是空白。

相比之下,EBT是目前为止最接近「人类式思考流程」的方案。

越想越准!Transformer望尘莫及

EBT不仅在理论特性上惊艳四座,在实际实验中也表现惊人。

无论有多少数据、加多大批次,模型有多深,EBT都比经典Transformer++学得更快、更省、效果更稳。

具体而言,要达到相同的困惑度(Perplexity),EBT的下降速度快35.98%。也就是说,它只需大约2/3的训练语料,在「数据瓶颈」的情况下更具性价比。

在分布式大批次训练环境下,EBT训练收敛速度比Transformer++快28.46%,深度扩展效率提升5.29%,效率不掉队。

在OOD(Out of Distribution)数据上,EBT也展现出更强的稳健性。

EBT能通过「多轮推理」与「自我验证」大幅缓解泛化性能下降的问题。

相比之下,传统 Transformer++ 的表现几乎不随推理次数改变。

这意味着,哪怕EBT预训练指标比Transformer略差,一旦开始「思考」,它就能后来居上,「越想越准」。

这种「思维带来泛化」的机制,在当前所有主流大模型架构中都是独一无二的。

跨模态通吃:AGI更近一步

只要定义清楚「输入」和「候选预测」,EBT就能在无监督中思考和优化。

EBT的设计不依赖监督、不依赖额外奖励、不局限于文本或编程,天然适用于任意模态与任务。

对于文本,EBT 能自动学出不 同词的规律:简单词能量低,难词能量高,借此自然表达出语义上的不确定性。

在图像任务中,EBT告别Diffusion模型的上百步生成式推理,仅用1%的推理步数就能超越Diffusion Transformer(DiT)在图像去噪和分类上的表现。

视频帧的「不确定性」预测和注意力调整更是不在话下。

这种统一、灵活、高效的推理机制,很可能成为通往「通用智能」的关键。

毕竟,关于大模型的终极疑问始终存在:它们,真的会「思考」吗?

EBT,或许就是首批有资格回答这个问题的架构之一。

参考资料:

https://x.com/AlexiGlad/status/1942231878305714462

https://x.com/du_yilun/status/1942236593479102757

https://arxiv.org/pdf/2507.02092

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
德天空:克洛普不会征召昂达夫

德天空:克洛普不会征召昂达夫

懂球帝
2026-09-16 05:24:20
中国游客在韩国偷拍被起诉,依韩国法律可处7年以下有期徒刑,或5000万韩元以下罚金

中国游客在韩国偷拍被起诉,依韩国法律可处7年以下有期徒刑,或5000万韩元以下罚金

红星新闻
2026-09-15 19:48:38
希拉里公开亮明态度:如果以色列人还想再选内塔尼亚胡一次,那么美国必须采取非常强硬的立场

希拉里公开亮明态度:如果以色列人还想再选内塔尼亚胡一次,那么美国必须采取非常强硬的立场

人生录
2026-09-15 00:05:11
急了,美国总统公开承认了。9月14日,美国总统特朗普公开承认,说美国正在努力补充并扩大武器生产。

急了,美国总统公开承认了。9月14日,美国总统特朗普公开承认,说美国正在努力补充并扩大武器生产。

回京历史梦
2026-09-15 17:04:05
再不拿下!卡里克帅位不保!曼联头号水货彻底拖死全队

再不拿下!卡里克帅位不保!曼联头号水货彻底拖死全队

澜归序
2026-09-16 08:45:20
丈夫拦我和前男友出差,我扔下离婚协议,一条通知让我懵了

丈夫拦我和前男友出差,我扔下离婚协议,一条通知让我懵了

晓艾故事汇
2026-05-03 10:19:26
无语了!某大学生怀疑自己怀孕了,网友:最不该生娃的却百发百中

无语了!某大学生怀疑自己怀孕了,网友:最不该生娃的却百发百中

另子维爱读史
2026-09-15 19:58:02
我陪领导去上头部门要拨款,大领导拍桌子训话,我直接反拍桌子喊了声二叔,身旁的领导两腿一软直接看呆了

我陪领导去上头部门要拨款,大领导拍桌子训话,我直接反拍桌子喊了声二叔,身旁的领导两腿一软直接看呆了

晓艾故事汇
2026-09-15 09:49:36
无感式穿搭,一点点动心也没有!

无感式穿搭,一点点动心也没有!

分享情感的梅梅
2026-09-15 08:05:16
扎哈罗娃“惭愧”承认:之前并不知道“百闻不如一见”是从中国传来的

扎哈罗娃“惭愧”承认:之前并不知道“百闻不如一见”是从中国传来的

环球网资讯
2026-09-15 06:58:37
高市早苗赌赢了!中国最担心的事发生了?

高市早苗赌赢了!中国最担心的事发生了?

故事终将光明磊落
2026-09-15 09:52:12
卡里克帅位不保!曼联锁定英超冠军名帅!换帅倒计时开启

卡里克帅位不保!曼联锁定英超冠军名帅!换帅倒计时开启

一隅非生
2026-09-16 10:40:13
美军一个排的标准编制,想消灭美军一个排有多难?

美军一个排的标准编制,想消灭美军一个排有多难?

莫地方
2026-09-14 23:20:02
谷维素是治疗失眠、高血脂的良药,医生提醒:服用时注意4个问题

谷维素是治疗失眠、高血脂的良药,医生提醒:服用时注意4个问题

医学科普汇
2026-09-15 18:20:05
曾致1死2伤!上海市民10.5万元买的二手车竟是“全损车”,法院判决后仍有隐忧→

曾致1死2伤!上海市民10.5万元买的二手车竟是“全损车”,法院判决后仍有隐忧→

新民晚报
2026-09-15 18:31:21
获央媒称赞!国脚退役后在上海当19年城管 网友:与刘翔截然不同

获央媒称赞!国脚退役后在上海当19年城管 网友:与刘翔截然不同

念洲
2026-09-15 13:47:55
难以置信!老外场馆内抽烟,上海执勤女安保殷勤递火,评论区瞬间炸锅

难以置信!老外场馆内抽烟,上海执勤女安保殷勤递火,评论区瞬间炸锅

火山詩话
2026-09-15 06:34:44
网友称iOS 27正式版出现离谱Bug,或致iPhone出现严重卡顿、触控失灵甚至直接卡死

网友称iOS 27正式版出现离谱Bug,或致iPhone出现严重卡顿、触控失灵甚至直接卡死

鲁中晨报
2026-09-16 09:23:11
社保局工作人员坦言:最近三年退休的人,是实打实的养老幸运儿

社保局工作人员坦言:最近三年退休的人,是实打实的养老幸运儿

兵鉴史
2026-09-14 20:14:40
71.24度电池!华为乾崑新车曝光:9月12日外观亮相

71.24度电池!华为乾崑新车曝光:9月12日外观亮相

科技阿维
2026-09-13 15:12:05
2026-09-16 10:59:00
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
16195文章数 67070关注度
往期回顾 全部

科技要闻

赛力斯接管问界,撑得住华为给的身价吗?

头条要闻

女子给娃报课遭贩卖焦虑交12万元:成为"弟子"需35万

头条要闻

女子给娃报课遭贩卖焦虑交12万元:成为"弟子"需35万

体育要闻

AK47到底有多强?

娱乐要闻

郭德纲挨罚刚一周,相声圈再传噩耗!

财经要闻

一个月跌掉2100亿!谁在“围猎”宁王?

汽车要闻

全新理想i9 Home试驾体验:有乐趣又体贴的新“家”

态度原创

游戏
旅游
健康
艺术
公开课

《金刚狼》评价不一《战神:劳菲》或面临更大压力

旅游要闻

今年前8个月访港旅客约3667万人次 同比升11%

脑血管里有个“不定时炸弹”?

艺术要闻

繁花 | 扎尔卡尔·特尼尔贝迪耶夫的花卉油画 18幅

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版