网易首页 > 网易号 > 正文 申请入驻

UIUC与哈佛联手发现训练循环分解法,让模型学会"多选一"

0
分享至


这项由伊利诺伊大学厄巴纳-香槟分校(UIUC)与哈佛大学联合开展的研究,以预印本形式于2026年7月29日公开发布,论文编号为arXiv:2607.27372。感兴趣的读者可通过该编号在arXiv平台检索到完整论文。

**一、生成式AI一直有个隐藏的"软肋"**

要理解这篇研究在解决什么问题,先来考虑一个生活场景:你让一个厨师帮你猜测"全班同学今晚想吃什么"。班里有人想吃麻辣火锅,有人想吃清淡沙拉,有人想吃甜点蛋糕。如果厨师只能做出一道菜,而且他的目标是"最不让人失望",他可能会做出一道不辣不淡、半甜半咸的奇怪混合物——结果反而没有一个人真正满意。

这个困境在AI领域有个专业名称,叫做"模式模糊"(mode blurring)。当一个AI模型被训练去预测多种可能正确答案中的某一个时,它往往倾向于输出所有答案的"平均值"——一个看起来四不像、实际上哪种可能性都不符合的混沌结果。你让图像生成AI画一只"坐着的狗",由于狗可以用无数种姿势坐着,AI不确定该选哪种,便输出一张模糊的、像素重叠的朦胧轮廓图。

这个问题困扰着当今所有主流的生成式AI系统——包括能画图的扩散模型(Diffusion Models)、能写文章的自回归语言模型(Autoregressive Models),以及各种视频生成系统。更关键的是,这些系统为了绕开这个问题,采用了一种权宜之计:把生成过程切成很多小步骤,让每一步只面对一个"几乎只有一个正确答案"的小问题,从而避免模糊。就好像那位厨师不是一次性做出一道全班的菜,而是先决定"加不加辣",再决定"用什么食材",再决定"怎么烹饪"……每一步选择都足够确定,最终拼出一道菜。

这个"分步生成"的策略确实有效,却带来了一个新的麻烦:**训练时和实际使用时,模型的工作方式完全不一样**。训练时模型只学会了处理单步预测,真正使用时却要串联几百上千个步骤。这就像一个厨师只练习过单独切菜、单独翻炒、单独摆盘,从没把这三件事连起来练过——真正上灶时,各步之间就会出现衔接错误,整道菜的质量就会下降。AI领域称这种现象为"训练-推理不匹配"或"曝光偏差"(exposure bias)。

能不能找到一种方法,既解决模式模糊问题,又不需要把生成过程拆开——从而让AI真正实现"端到端"(end-to-end)训练?这正是这篇论文的核心追问。

**二、一个简单却被忽视的洞察:分解训练,而非分解生成**

研究团队发现,生成式模型本质上只有两件事可以"分解":生成过程,或者训练过程。过去所有主流方法都在分解生成过程——把输出切成很多步。但如果反过来,分解的是训练过程本身,会发生什么?

这就是研究团队提出的"探索式建模"(Explorative Modeling,简称XM)的核心思想。其机制出奇地简单:在每一轮训练中,模型不是只生成一个候选答案,而是生成K个候选答案,然后把最接近真实数据的那一个拿出来训练,其余的丢弃。

回到厨师的比喻:与其让厨师做一道"平均菜",不如让他同时做出K道不同的菜,然后问班级里的那个学生"哪道最像你想吃的",再让厨师只从那道菜里学习。这样一来,厨师不再需要做平均,而是会慢慢学会"在不同情境下选择不同的菜单"——也就是说,他开始真正理解了多样化的需求。

在AI中,这K个候选答案来自不同的随机噪声输入。每次训练时,模型同时尝试从K个不同的起点出发生成答案,然后找到哪个起点生成的结果最接近真实数据,并只针对那个起点进行优化。随着训练进行,不同的噪声输入开始"专门负责"不同类型的输出——一个噪声区域专门负责生成坐姿正面的狗,另一个负责侧身趴着的狗,以此类推。

这个K——也就是每次探索多少个候选——就成了一个可以调节的新旋钮。研究团队称其为生成式AI训练的**第三个预训练轴**:前两个轴是模型参数规模(模型有多大)和数据量(训练了多少数据),第三个轴就是探索量(每次训练时尝试了多少种可能性)。

**三、"生成表达力":一个被整个领域忽视的关键概念**

为了让这个新轴的重要性更清晰,研究团队引入了"生成表达力"(Generative Expressivity)这个概念。用最朴素的语言来说,它衡量的是:**一个AI模型在最理想状态下,最多能同时"理解"多少种不同的正确答案**。

一个只做平均预测的模型,生成表达力只有1——它的最佳可能输出永远只是各种答案的混合平均值,连一个真正存在的答案都不是。而通过探索K个候选,模型的生成表达力至少提升到K——它可以同时捕捉至少K种截然不同的可能性。

这个概念的重要性在于:它独立于参数规模和数据量。无论你把模型做多大、喂多少数据,如果训练目标的生成表达力是1,那么模型的最佳输出依然是那个模糊平均值。就像无论你雇用多少厨师、有多少食材,只要规则是"做出让所有人平均满意的菜",结果就永远是那道四不像。

研究团队还指出,现有最强大的生成模型依赖"分类器自由引导"(classifier-free guidance,CFG)技术来提升输出质量——这个技术本质上是让模型"远离自己的平均预测",这恰恰说明这些模型本身就存在模式模糊问题。连最顶尖的系统都需要这种后处理技巧来纠偏,正是因为它们的生成表达力不够高。

**四、两种探索方向:前向XM与反向XM**

研究团队详细设计了两种具体的探索机制,分别适用于不同场景,两者可以理解为从不同方向寻找最佳配对。

前向XM(Forward XM)的逻辑是:固定一个真实数据样本,然后生成K个候选,找出哪个候选最接近这个真实样本,只训练那个候选对应的路径。这就像班级里的学生定好了想吃火锅,厨师同时做出K道不同风味的火锅,学生指出"第3道最像",厨师就从第3道里学习。前向XM的优点是它覆盖了数据分布的所有部分——每个真实样本都会被某个候选所"对应",不会有数据被遗漏。缺点是每增加一个候选K,就需要多进行一次完整的模型前向计算,计算成本随K线性增长。

反向XM(Reverse XM)的逻辑则相反:固定一个模型生成的样本,然后从数据集中随机采样K个真实样本,找出哪个真实样本最接近这个生成结果,并训练模型向那个真实样本靠近。这就像厨师做了一道菜,然后在K位学生里找出"觉得这道菜最符合自己口味"的那位,并根据他的反馈调整。反向XM的计算成本几乎不随K增加——因为它只需要做一次模型前向计算,K只影响数据采样,而采样比生成便宜得多。反向XM的挑战是它倾向于"精准但不全面"——模型可能学会只生成数据集里最常见的几种类型,而忽视长尾情况,这在统计学中叫做"模式塌缩"(mode collapse)。

从理论上看,前向XM等价于对模型生成的K个候选混合分布进行最大似然估计——这个解读在每个K值下都成立,随着K增加,被拟合的分布从一个单一高斯分布(K=1时就是普通回归)变成一个K成分的混合分布,能容纳K种不同的模式。反向XM则优化的是"反向KL散度",是一种"寻找模式"而非"覆盖全部"的目标,因此需要加入额外的熵奖励来防止塌缩。两种方法各有侧重,在实践中可以结合使用以平衡精准度和覆盖率。

**五、实验结果一:探索让现有模型又快又好**

研究团队将探索机制叠加到多种已有的生成模型上,结果令人印象深刻。

在图像生成任务上,研究团队以当时(2026年初)最先进的图像生成配方RAE(Representation Autoencoder,表示自编码器)作为基础进行测试。评估指标使用的是FID(Fréchet Inception Distance,衡量生成图像与真实图像分布的差异,越低越好)以及FDr6(一种在高性能水平下更精细的评估指标)。

结果显示,仅仅把探索候选数K从1增加到2或3,就能让模型用**6.2倍更少的训练数据**达到原版模型的最终性能水平,并且只需要**原来41%的计算量(FLOPs)**就能达到相同效果。换句话说,同样花100块钱训练,加了探索机制的模型比没加的强得多;或者说,要达到同一个目标质量,加了探索只需要花原来六分之一的钱。

在参数效率方面,一个"大号"(Large)加了5个探索候选的模型,最终表现超过了参数量多出47%的"超大号"(XLarge)不带探索的模型。换句话说,探索可以让小一号的模型打败大一号的模型,直接省下大量的硬件和电力成本。

研究团队还发现,**探索带来的好处随着规模增大而增大**——而不是饱和或减弱。在规模较小的实验(SiT基础配方)中,探索使FLOP效率提升约52%;放大到3倍计算量的RAE配方后,效率提升变成了4.1倍。数据规模和模型规模的实验同样印证了这一趋势:随着训练数据增加,探索带来的改进从7%一路攀升至36%;随着模型参数增加,改进从13%增至23%。这种"越大越有效"的特性,正是一个真正的新训练轴所应具备的特征——就像模型越大数据越多越有收益,探索也同样如此。

**六、实验结果二:多模态、多场景,探索普遍有效**

探索机制的效果不局限于图像生成一个领域。

在视频生成任务中,研究团队使用了Something-Something V2数据集,训练了目标条件视频生成模型。随着探索候选数K的增加,FVD(Fréchet Video Distance,衡量生成视频质量的指标,越低越好)持续单调下降,没有出现饱和迹象。更值得关注的是**泛化能力的提升**:研究团队在固定大小的数据集上训练模型直到验证集性能开始下降(即过拟合),发现加了探索的模型不仅最终性能更好,而且过拟合的程度更轻。没有探索的模型最好FVD是37.5,加了探索后降至30.0——这意味着探索让模型从同样的数据中"学到了更多本质规律,而非死记硬背"。

在离散语言生成任务上,研究团队把探索机制加入到"掩码扩散语言模型"(MDLM,一种生成文本的扩散式模型)中。对于8步和256步两种推理配置,加了8个探索候选的XM版本在生成困惑度-熵曲线的所有点上都优于原版模型。这说明探索不仅对连续域(图像、视频)有效,对离散域(文字)同样管用。

**七、实验结果三:更端到端的模型从探索中获益更多**

这里有一个非常有趣的发现,揭示了探索与端到端训练之间的深层关系。

研究团队比较了两类模型:标准的扩散/流匹配模型(需要50步采样,生成过程高度分解)和"Jumpy"模型(可以使用更少的步数,更接近端到端,比如10步甚至1步)。结果发现,**Jumpy模型从探索中获得的提升幅度远大于标准扩散模型**。

更进一步,研究团队在Jumpy模型框架内比较了不同步数设置——步数越少说明模型越端到端。当探索候选K较少时,步数多的模型(更分解的生成过程)表现更好;但随着K增加,步数少的模型(更端到端的生成过程)逐渐超越。这意味着**探索与分解生成过程确实是可以相互替代的**:你可以用多分解生成步骤来获得生成表达力,也可以用多探索来获得相同效果——两者在功能上是可以互换的。

这个发现有着深远的含义:它意味着"模型应该用多少步生成"不再是一个固定的设计决策,而是一个可以随探索量动态调整的变量。随着探索增加,最优的生成步数自然下降,模型越来越端到端。研究团队将这称为"把端到端程度从固定设计选择变成可扩展的选择"。

**八、实验结果四:完全端到端的探索式模型**

既然探索可以替代分解生成过程,把K增大到足够大,是否可以完全不分解生成、实现真正的端到端生成式模型?

研究团队在机器人控制任务上测试了这个想法。他们设计了两套端到端XM模型:用于"行为克隆"(让机器人模仿人类操作数据)的"探索式策略"(Explorative Policy),以及用于"目标条件世界建模"(让AI预测从当前状态出发如何到达目标状态)的"探索式世界模型"(Explorative World Model)。

在Robomimic基准测试的五个机器人操作任务(抬起物体、用罐子装东西、组装方块、搬运物品、操作工具)上,探索式策略仅需**1次模型前向计算**就达到了与Diffusion Policy(需要100次前向计算)完全相当甚至略好的成功率。具体来看,Diffusion Policy在五项任务上的成功率分别是100%、100%、94%、72%、86%,而探索式策略是100%、100%、96%、74%、86%——几乎全面持平或略胜,却只花了1/100的推理计算量。

在Maze2D迷宫导航任务上,探索式世界模型与Diffuser(需要64至256次前向计算)相比,总体得分从127.2提升到130.0,而平均前向计算次数从192次骤降至2.3次——也就是说,**用平均约80倍更少的推理计算量,取得了更好的效果**。

这些结果来自对超参数几乎没有专门调优的情况——研究团队基本沿用了原始扩散模型的架构设置,只是用探索机制替代了多步扩散训练。研究团队认为,专门为XM设计的架构和超参数可以进一步提升效果。

**九、为什么扩大探索的好处不会停止增长?**

这是整篇论文中最耐人寻味的一个问题:为什么探索的好处不会随着K增大而饱和,反而随着模型和数据规模增大而愈发显著?

研究团队给出了一个颇具说服力的解释。生成式模型的性能受到三种能力的共同约束:参数规模(决定模型能表示什么)、数据量(决定模型能学到什么)、以及生成表达力(决定模型能生成什么)。在小规模实验中,参数和数据往往是主要瓶颈;随着参数越来越大、数据越来越多,这两个瓶颈逐渐被解除,生成表达力就越来越突出地成为主要限制。

换句话说,当模型已经足够大、数据已经足够多时,继续增加参数和数据的边际收益在下降,但提升生成表达力的边际收益却在上升。当今最大规模的基础模型训练所用的计算量,比这篇论文中最大实验的计算量还要大出大约四个数量级(万倍)。如果这个趋势在更大规模上依然成立,那么论文中报告的那些效率提升数字,可能只是实际规模下可获得收益的一个下限——真实的收益可能远超这些数字。

**十、Reverse XM的独特设计与语言模型的挑战**

对于语言模型,前向XM有一个实践上的困难:每增加一个候选K,就需要多生成一次完整的文本序列,对于长文本来说成本很高。反向XM则可以通过向量数据库(一种能快速查找相似内容的索引结构)来解决这个问题——让模型生成一段文字,然后在整个训练数据集里找出最相似的那段,训练模型向它靠近。

研究团队已经初步实现了这种反向XM语言模型,关键设计是两点:第一,一旦某个训练样本被"匹配使用",就在当前epoch内将其从候选池中移除,防止模型总是只匹配最常见的几个样本;第二,相似度搜索在表示空间和交叉熵空间的混合度量下进行,确保搜索结果真正反映训练损失。

对于自回归语言模型(如GPT风格模型),探索的效果相对有限,原因在于:自回归模型已经通过"每次只预测下一个词"的机制获得了很高的生成表达力——每一步的条件已经足够丰富,模式模糊程度本身就比连续生成模型低很多。探索对它们的帮助存在,但不如对扩散模型那么显著。研究团队认为,多词预测(multi-token prediction)等面临更强多模态性的任务,以及具有显式潜在变量的自由变换器(Free Transformer)架构,可能是探索在语言领域更有效的突破口。

**十一、探索并不等于记忆,也与强化学习无关**

两个常见的误解值得澄清。

第一个误解是"训练自己的生成结果会导致模型记忆训练数据"。实际上,XM的训练目标始终是真实数据——模型的生成结果只是决定了"哪条噪声路径被选来优化",真正的学习信号来自真实数据样本。在前向XM中,每一个真实数据样本都会在某个候选里找到对应,整个数据分布都被覆盖,本质上是一种最大似然学习。大规模数据集本身会抑制记忆,因为远超模型容量的数据量迫使模型学习数据的结构规律,而非逐条记忆。

第二个误解是"探索式建模是一种强化学习"。强化学习中的"探索"是指智能体尝试不同行动来发现奖励,涉及时序决策和奖励反馈。XM中的探索是在单次训练步骤内同时尝试多个候选,选最好的训练——它没有时序、没有奖励信号,只是一种选择最佳训练配对的机制。两者虽然名字相似,机制和目的完全不同。

归根结底,这篇论文的核心贡献可以用一句话概括:**"探索"——在训练时试探多种可能、选最好的学——是生成式AI的一个独立的、可扩展的新维度,与模型大小和数据量并列,而且随着前两者的增长,这第三个维度的重要性只会越来越大。**

过去十余年,我们一直在问"AI要多大才够""要多少数据才够"。现在又多了一个问题:**AI要探索多少才够**。而且答案和前两个问题的答案一样:越多越好,越大越好,还没有见到尽头。

Q&A

Q1:探索式建模(Explorative Modeling)为什么不会导致生成结果越来越像训练数据、最终记忆训练集?

A:因为探索式建模的训练目标始终是真实数据,模型自己的生成结果只起到"选择哪条噪声路径被优化"的作用,学习信号来自真实样本而非模型输出。加之大规模数据集本身就是抑制记忆的天然防护,模型被迫学习数据结构而非逐条背诵。

Q2:探索候选数K应该设成多少才合适?

A:研究团队建议从K=2或3开始尝试,计算资源充裕时再测试K=5、8、12。实验显示K=2或3就能带来显著提升,且随着训练时间和模型规模增加,最优K值也在增大,说明这是一个需要和模型规模一起扩展的参数。

Q3:反向XM(Reverse XM)和前向XM(Forward XM)分别适合什么场景?

A:前向XM固定真实数据、探索多个生成候选,覆盖数据分布全面,但每增加一个候选就需要多一次完整生成,计算成本随K线性增加,适合对质量要求高且计算资源充裕的场景。反向XM固定一个生成结果、在数据中搜索最近邻,计算成本几乎不随K增加,更适合高度多模态的分布,但需要加入熵约束防止模式塌缩,适合大规模数据索引场景。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
张雪机车车主在内蒙古被恶意别车还遭持棍攻击,张雪喊话公司律师:这么狂?教他礼貌

张雪机车车主在内蒙古被恶意别车还遭持棍攻击,张雪喊话公司律师:这么狂?教他礼貌

Mr王的饭后茶
2026-08-10 16:42:02
王楚钦的退役信号越来越明显,会不会不参加洛杉矶奥运?

王楚钦的退役信号越来越明显,会不会不参加洛杉矶奥运?

最爱乒乓球
2026-08-06 01:47:09
阿媒:梅西决定留在阿根廷陪伴家人,帕雷德斯等人将前往探望

阿媒:梅西决定留在阿根廷陪伴家人,帕雷德斯等人将前往探望

懂球帝
2026-08-11 01:27:09
恭喜,他们宣布复婚!网友破防:兜兜转转还是你

恭喜,他们宣布复婚!网友破防:兜兜转转还是你

背包旅行
2026-08-10 15:09:11
警卫员披露:76年周总理追悼会前,汪东兴曾下达密令,追悼会延迟

警卫员披露:76年周总理追悼会前,汪东兴曾下达密令,追悼会延迟

浔阳咸鱼
2026-08-05 08:50:11
上海女子为省房租与房东同住6年,房东生病,她一句话暖了房东心

上海女子为省房租与房东同住6年,房东生病,她一句话暖了房东心

兰姐说故事
2025-11-17 20:40:03
异性之间:发现一个很玄学的现象,一个女人如果不花这个男人的钱,他们的感情基本不稳固

异性之间:发现一个很玄学的现象,一个女人如果不花这个男人的钱,他们的感情基本不稳固

LULU生活家
2026-08-10 20:22:09
名嘴:现在只有孙颖莎能压住张本美和了 但洛杉矶奥运不能把压力全给莎莎

名嘴:现在只有孙颖莎能压住张本美和了 但洛杉矶奥运不能把压力全给莎莎

818体育
2026-08-10 22:00:14
正式通车!350km/h超级高铁落地浙江!彻底终结沿海小城无高铁历史

正式通车!350km/h超级高铁落地浙江!彻底终结沿海小城无高铁历史

三农老历
2026-08-10 16:37:32
北京人心里的学校档位,人大没排前面,北京联合大学也被拿来聊,差的不是名单是记忆

北京人心里的学校档位,人大没排前面,北京联合大学也被拿来聊,差的不是名单是记忆

马蹄烫嘴说美食
2026-08-10 05:54:26
《繁花》大雷!涉毒偷税坐实,王家卫这次彻底完了

《繁花》大雷!涉毒偷税坐实,王家卫这次彻底完了

乡野小珥
2026-08-11 02:29:10
长崎核爆81周年当天,日本给南京大屠杀改名?高市早苗闯下大祸!

长崎核爆81周年当天,日本给南京大屠杀改名?高市早苗闯下大祸!

天气观察站
2026-08-10 12:12:40
别再骂印度不要脸!看懂背后真实算计,才知这是一场精准的无赖博弈

别再骂印度不要脸!看懂背后真实算计,才知这是一场精准的无赖博弈

浪子的烟火人间
2026-08-11 00:05:04
未来几天,什么时候雨最大?北京市气象台首席预报员研判——

未来几天,什么时候雨最大?北京市气象台首席预报员研判——

BRTV新闻
2026-08-10 16:43:19
单亲妈啃剩菜,女儿火锅炫400块发朋友圈忘屏蔽,妈妈破防:你们养的狗都比我过得好!

单亲妈啃剩菜,女儿火锅炫400块发朋友圈忘屏蔽,妈妈破防:你们养的狗都比我过得好!

一丝不苟的法律人
2026-07-31 17:11:22
刚刚预报:天津局地有特大暴雨!主要降雨时间段→

刚刚预报:天津局地有特大暴雨!主要降雨时间段→

天津人
2026-08-10 19:19:41
多轮高温来袭 “蒸煮”模式开启

多轮高温来袭 “蒸煮”模式开启

中国经济网
2026-08-10 07:26:11
勇夺菲尔兹奖仅半月,王虹再迎喜讯,这次她让整个学术圈“沉默”

勇夺菲尔兹奖仅半月,王虹再迎喜讯,这次她让整个学术圈“沉默”

悠悠说世界
2026-08-10 03:37:31
正式离队!王浩然新决定,深圳男篮支持

正式离队!王浩然新决定,深圳男篮支持

泥说体育
2026-08-10 23:59:34
比伊朗导弹还致命,5000名美航母兵对外求救,马上就要崩溃了

比伊朗导弹还致命,5000名美航母兵对外求救,马上就要崩溃了

究竟谁主沉浮
2026-08-10 20:24:31
2026-08-11 04:36:49
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9473文章数 568关注度
往期回顾 全部

科技要闻

马斯克又放大招:星链要吃掉全球一半流量

头条要闻

16岁少年强行抱女友跳河自杀 自己爬上岸放任女友溺亡

头条要闻

16岁少年强行抱女友跳河自杀 自己爬上岸放任女友溺亡

体育要闻

阿森纳的39号球衣,有了最适合的主人

娱乐要闻

演员秦焰去世 享年72岁

财经要闻

最多卖166亿港元,李嘉诚又要套现了

汽车要闻

搭载猎鹰500/限时售10.49万起 2027款艾瑞泽8PRO上市

态度原创

旅游
房产
健康
教育
公开课

旅游要闻

大美芦芽山·宁化古城文化旅游季暨短视频大赛正式启幕

房产要闻

海南最难被说服的一群人,把15亿投给了同一个项目!

咸汤圆比甜汤圆更健康?别被误导了

教育要闻

高考地理必背知识点:自然地理+人文地理

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版