网易首页 > 网易号 > 正文 申请入驻

生成模型也能端到端训练了?核心竟是一个for循环

0
分享至

来源:市场资讯

(来源:机器之心)

编辑|Panda

2012 年,AlexNet 用一场压倒性的胜利终结了一个时代。在此之前,做图像识别要靠人手工设计一层层特征提取的流程;AlexNet 证明了一件后来被反复验证的事:把整个任务端到端地交给模型自己学,几乎总是打得过人类精心设计的分阶段流水线。

从图像分类到目标检测再到图像分割,深度学习的每一次跃迁背后,都是同一句话:让它自己一口气学完。

只有一个领域始终是例外:生成模型。

今天最强、最能扩展的生成模型(无论是自回归还是扩散模型)都不是端到端的。

它们训练时只学预测「一小步」,推理时却要像循环网络那样把这一步反复展开几百上千次。

训练和推理用的不是同一套采样方式。这个裂缝带来了一个老问题:每一步的误差会喂进下一步,输入逐渐漂离训练时见过的分布,误差层层累积。学术上管它叫「暴露偏差」(exposure bias)。

换句话说,「端到端更好」这条深度学习最核心的经验,十几年来始终没能真正落到生成模型头上。

而就在最近,一篇来自 UIUC 与哈佛大学的论文,试图把这块最后的拼图补上。


作者给这个新范式起了个名字,叫 Explorative Modeling(探索式建模),模型简称 XM。它的想法简单到近乎朴素,却指向一个大胆的结论:生成模型除了参数和数据,其实还有第三根可以放大的轴。


  • 项目网站:https://explorative-modeling.github.io

  • 论文地址:https://arxiv.org/abs/2607.27372

  • 代码仓库:https://github.com/alexiglad/XM

问题的根源:模型只会「取平均」

要理解这篇论文在解决什么,得先理解生成到底难在哪。

普通的监督学习(比如分类)每个输入基本只有一个正确答案,模型学一个确定的映射就够了。

但生成不一样。你让模型「生成一只狗」,正确答案甚至可能有无穷多个。这些合法的输出,就是数据分布里的一个个 mode(即分布中一个个独立的峰)。生成难,正是因为要同时抓住这么多 mode。

麻烦在于,主流生成模型训练时用的是重构损失(比如平方误差)。当一个输入被随机配上了许多个不同的合法目标,重构损失能给出的最优解,是这些目标的平均值。而对绝大多数数据来说,平均值根本不在数据流形上,而落在几个 mode 中间,谁也不像。

论文里那张图很直观:让模型在没有任何技巧的情况下直接端到端地回归,三堆散点会被它预测成正中间的一个点,一张狗的照片会糊成一团,一句话会退化成把「the」重复到底。这就是「mode 模糊」(mode blurring),即最优解恰恰是最不像真实数据的那个答案。


现有模型是怎么绕过去的?答案是把「生成」这件事拆碎。自回归一次只预测一个元素,扩散一次只去掉一点噪声,每一小步的目标都被切到几乎只剩单一 mode,于是重构损失就不会再去取平均。

这套「拆分生成过程」正是扩散和自回归能做出高质量样本的原因,但也正是它,让模型没法端到端。

作者由此提出了一个关键的追问:一个生成模型只有两样东西可以拆,一个是怎么生成,一个是怎么训练。

既然拆生成这条路会毁掉端到端,那为什么不去拆训练呢?


一个 for 循环:探索式建模的全部内核

Explorative Modeling 拆的就是训练循环本身。

它的机制可以用一句话说清:在每一个训练步,模型不再只生成一个样本去硬凑目标,而是生成 K 个候选,然后只挑其中离真实数据最近的那一个来训练、回传梯度。论文里把它实现成一个 3 到 5 行的 for 循环,简单到有点让人怀疑(Algorithm 1)。


为什么这么做就能解决 mode 模糊?

换个生活里的场景:猜飞镖落点。如果只让你猜一次,你的最优策略是猜所有飞镖的平均位置,可那往往是靶盘上根本没几支飞镖扎中的地方。但如果允许你猜 K 次、且只按最接近的那一次算分,最优策略立刻变了:你会把这几次猜测散开,让每一次去覆盖一簇不同的落点。


模型也是一样。当它被允许探索 K 个候选,不同的输入噪声就会各自「认领」一个不同的 mode,而不是全都挤到中间去取平均。探索多少次,模型就能稳稳抓住多少个 mode。


作者给这个被长期忽视的能力起了个名字:生成表达力(generative expressivity),并指出它由训练目标本身决定,无论你把参数和数据堆到多大,它都不会自己涨上去。


这也解释了一个业内早就观察到的怪现象:为什么今天最好的模型都那么依赖「引导」(guidance)技术。

所谓无分类器引导,本质是把预测「推离」那个模糊的平均值。但如果模型自己不糊,又何必去推它? 引导之所以有用,恰恰是 mode 模糊留下的病根。

论文还给出了 Forward 和 Reverse 两种探索方向:前者固定一个真实目标、在自己的生成里搜最近的一个,偏向「查全」(覆盖所有 mode);后者固定一个生成、在真实数据里搜最近的一个,偏向「查准」,且几乎不增加算力开销,代价是可能塌缩到少数 mode。两者互补,可以组合使用。



第三根轴:越放大,收益越大

这篇论文最有分量的结论,是把「探索」验证成了一根真正的 scaling 轴。

作者把探索加到扩散/流模型、Jumpy 模型乃至掩码扩散语言模型上,在图像、视频、语言三种模态上一致地看到性能单调提升。更关键的是收益随规模的走向:越放大越猛。

论文给出的数字是:随着数据规模增长,探索带来的增益从 7% 一路爬到 36%;随着模型增大,从 13% 爬到 23%;当算力翻到三倍时,效率增益直接翻了一倍多。

具体到效率上,探索把 FLOP 效率提升了 4.1 倍、样本效率提升了 6.2 倍、参数效率提升了 47%。在图像生成上,它把当前最强的 RAE 配方进一步推到了 ImageNet 上无引导 1.43 的 FID,逼近业界最好水平。


一个探索 5 个 mode 的 Large 模型,甚至能跑赢一个多了 47% 参数却不做探索的 XLarge 模型。


这个走向的含义并不小。作者的解释是:小规模时,模型主要被参数和数据卡着,生成表达力还不是瓶颈;可一旦参数和数据放大到「不再是限制」的地步,生成表达力就会越来越成为那个真正的瓶颈。而它正是探索能直接放大的东西。

考虑到当下真正的基础模型训练,用的算力比这篇论文最大的实验还高出约四个数量级,作者认为论文里报出的这些数字,很可能只是更大规模下收益的下限。

真正端到端的生成

如果把探索推到极限,会发生什么?答案回到了开头那个悬念:生成模型终于可以端到端了。

作者把 XM 当作独立的端到端模型,拿去做机器人控制任务。在行为克隆(Behavior Cloning)上,他们的 Explorative Policy 只用一次网络前向就追平甚至超过了需要 100 次前向的 Diffusion Policy;在目标导向的世界建模上,Explorative World Model 用比 Diffuser 少 16 到 256 倍的推理算力,做到了更好的平均表现。



这个差距的来源很清晰:扩散模型是在推理时用几百步生成来换取表达力,而端到端的 XM 把这笔账挪到了训练时的探索上,推理因此只需一次前向。「处理多 mode」这同样一件事,要么在推理时慢慢拆,要么在训练时一次探索到位;这篇论文选择了后者。

作者介绍

这篇论文的第一作者 Alexi Gladstone 并不是生面孔。就在 2025 年 7 月,他主导的 Energy-Based Transformers(EBT)曾在社交平台上引发过不小的讨论。


那项工作声称首次在多个维度上「跑赢」了标准前馈 Transformer 的扩展曲线,并试图把「System 2 思考」推广到任意 mode。参阅机器之心报道《新范式来了!新能量模型打破 Transformer++扩展上限,训练扩展率快 35%》。


Explorative Modeling 与他一贯的思路一脉相承:都在追问「模型能不能通过某种搜索、探索的方式,去做单次前向做不到的事」。而这篇论文更是建立在他与合作者(Yilun Du 和 Heng Ji)的另一套理论 Mode Forcing 之上。论文里坦言,正因为有那套理论在先,XM 的大部分结果是先被理论预测、再被实验验证的,这在以「跑完实验再解释」为常态的深度学习圈里,并不多见。


作者也很坦诚地承认了局限:best-of-K 这个想法本身并不新,前人做过很多次;他们真正的贡献,是想清楚了这个简单循环到底在做什么:它在不拆分生成过程的前提下,直接放大了生成表达力。

此外,自回归语言模型目前仍是最难啃的骨头,纯端到端的 Forward XM 在极度多 mode 的分布(比如图像生成)上还太贵,这些都留给了后续工作。

十几年来,我们习惯了用两个旋钮去调生成模型:把它做得更大,喂它更多数据。

这篇论文提出的第三个旋钮相当朴素:让模型多猜几次、只留最好的一次。但如果它揭示的趋势成立,那么随着规模继续膨胀,前两个旋钮迟早会拧到头,而第三个才刚刚开始转动。

https://x.com/AlexiGlad/status/2083230922196107288

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
最年轻副总统的坠落时刻:从政坛金童到党内弃子

最年轻副总统的坠落时刻:从政坛金童到党内弃子

寰球经纬所
2026-08-01 17:48:16
“野莓”公司创始人明确表示不会对卖家作出任何赔偿

“野莓”公司创始人明确表示不会对卖家作出任何赔偿

山河路口
2026-08-01 20:13:04
国际足联公布世界杯半决赛阿根廷2比1英格兰的裁判视角集锦,贝林厄姆赛后对裁判讲话曝光:判罚令人震惊,但祝你好运

国际足联公布世界杯半决赛阿根廷2比1英格兰的裁判视角集锦,贝林厄姆赛后对裁判讲话曝光:判罚令人震惊,但祝你好运

艳儿说电影
2026-08-01 17:06:34
44 岁姚笛嘉兴夜市独自对瓶喝啤酒,当年全民追捧的甜妹只剩一身落寞

44 岁姚笛嘉兴夜市独自对瓶喝啤酒,当年全民追捧的甜妹只剩一身落寞

迪迪的娱乐故事
2026-08-01 15:14:33
有结果了!自费搜集日军罪证的杨宇轩遭威胁,对方身份曝光,是未成年人

有结果了!自费搜集日军罪证的杨宇轩遭威胁,对方身份曝光,是未成年人

小鋭有话说
2026-08-01 19:24:03
比亚迪员工怒斥食堂太黑心,垃圾饭菜15元,质问老板百年之后不怕下地狱吗?评论区一片吐槽!

比亚迪员工怒斥食堂太黑心,垃圾饭菜15元,质问老板百年之后不怕下地狱吗?评论区一片吐槽!

谭谈社会
2026-08-01 19:58:36
哈马斯解除武装,人类历史上最愚蠢的国际战略的结局

哈马斯解除武装,人类历史上最愚蠢的国际战略的结局

二湘空间
2026-08-01 18:49:47
恶臭!立陶宛新外长被问台湾当场破防,张嘴便是“滚回中国去”

恶臭!立陶宛新外长被问台湾当场破防,张嘴便是“滚回中国去”

用冷眼洞悉世界
2026-08-01 16:00:28
金灿荣谬论:贬低改革开放、话术夹带极左复古史观

金灿荣谬论:贬低改革开放、话术夹带极左复古史观

周哥一影视
2026-08-01 03:18:16
普京杜马告别演讲,俄罗斯大局已定!

普京杜马告别演讲,俄罗斯大局已定!

李荣茂
2026-08-01 07:24:39
36岁女博士婚期在即被退婚:未婚夫无法接受她曾在国外“和黑人同居过”

36岁女博士婚期在即被退婚:未婚夫无法接受她曾在国外“和黑人同居过”

晚风寄温柔
2026-08-01 00:42:56
天呐!华为把我投诉了!

天呐!华为把我投诉了!

麦杰逊
2026-08-01 22:29:32
再反转!敦煌硬刚绝不辞退,调查组介入仓促离职,幕后责任人隐身

再反转!敦煌硬刚绝不辞退,调查组介入仓促离职,幕后责任人隐身

社会日日鲜
2026-08-01 17:11:56
连云港母女坠楼事件发酵!女子39岁才生的女儿,率先逃生的父亲被网暴

连云港母女坠楼事件发酵!女子39岁才生的女儿,率先逃生的父亲被网暴

火山詩话
2026-08-01 07:38:46
燃油车时代会很快结束?内行人预测:油价很可能是最后的关键!

燃油车时代会很快结束?内行人预测:油价很可能是最后的关键!

白米饭怎么吃
2026-08-01 20:00:22
不准中国武力收台!北约称做好开战准备,话音刚落,中方强势表态

不准中国武力收台!北约称做好开战准备,话音刚落,中方强势表态

影孖看世界
2026-08-01 23:59:14
看完阿里董事会主席蔡崇信的离婚声明   才略懂何为教科书式的精英婚姻“分家不拆家”

看完阿里董事会主席蔡崇信的离婚声明   才略懂何为教科书式的精英婚姻“分家不拆家”

冷观互联网
2026-08-01 15:34:28
终于熬出头!高温结束时间已定,降温就在眼前!

终于熬出头!高温结束时间已定,降温就在眼前!

今日养生之道
2026-07-31 03:35:04
人社部财政部8月1日公布养老金调整通知及涨幅情况

人社部财政部8月1日公布养老金调整通知及涨幅情况

她不倾国倾城
2026-08-01 13:04:33
新冠确诊的人越来越多?医生再次强调:宁可喝冰水,也别做这9事

新冠确诊的人越来越多?医生再次强调:宁可喝冰水,也别做这9事

健康之光
2026-08-01 15:55:05
2026-08-02 06:23:00
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4288065文章数 9113关注度
往期回顾 全部

科技要闻

特斯拉拆不掉中国制造

头条要闻

德意等22国领导人紧急签联名信 西班牙首相反怼:自私

头条要闻

德意等22国领导人紧急签联名信 西班牙首相反怼:自私

体育要闻

1米76的他,为什么是史上最强中卫之一?

娱乐要闻

韩路批董宇辉“又当又立”?

财经要闻

长鑫科技四万亿市值背后的资本与周期

汽车要闻

历史性里程碑时刻 零跑7月交付达101267台

态度原创

健康
教育
艺术
房产
公开课

中风易复发!谈中风康复与二级预防

教育要闻

清华大学也能“爆冷”?清华提前批断档征集背后深度剖析

艺术要闻

这真的是素描?不是黑白照片?每一根毛发都在呼吸,放大一百倍都找不到一条废线!

房产要闻

1700亿砸下!信息量巨大!海南甩出又一个超级规划!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版