![]()
这项由Meta AI研究院(FAIR)、Meta现实实验室(Reality Labs)与英国牛津大学联合开展的研究,于2026年8月发表,论文编号为arXiv:2608.05000,感兴趣的读者可通过该编号查询完整原文。
如果把现代AI的发展比作一场厨艺进化之旅,那么最初的AI只会做一道菜——要么读懂文字,要么辨认图片。但今天的顶级AI厨师,已经能在同一口锅里同时炖语言、视觉理解与图像生成三道料理。问题是:这三道料理同锅炖煮,到底是相互提味,还是互相抢味?锅的大小怎么分配?下料的顺序有没有讲究?这些问题,就是这篇论文想回答的核心。
研究团队把这套探索过程称为"多模态预训练的物理学",意思是:就像物理学研究万物运行的基本规律一样,他们想找到AI多模态训练背后那些不变的、可预测的基本规律。他们通过大量精心设计的受控实验——既在真实的大规模网络数据上测试,也在人工合成的高度可控数据集上验证——系统性地解剖了语言、视觉理解与视觉生成这三者之间的关系。最终,他们整理出四条核心规律,并用一个130亿参数、在2万亿个词符上训练的巨型模型加以验证。
一、三种能力同锅炖,到底谁提味、谁抢味?
要理解这项研究,先得搞清楚现代"通用AI"在做什么。一个所谓的"统一多模态模型",同时承担三项任务:一是纯语言理解,就像读书看报;二是视觉理解,也就是看图说话,把图片翻译成文字;三是视觉生成,即根据文字描述画出图片。
研究团队想知道的是:这三项任务之间,知识是如何流动的?好比三个厨师共用一个灶台,他们的烹饪动作会不会互相影响?
研究的第一个发现,是流动是单向的、不对称的。语言这位"老师傅",对另外两个厨师都有巨大帮助——越多的语言训练数据,视觉理解和视觉生成的表现都会单调递增地提升。具体来说,当语言数据占比从0%提升到80%时,AI在识别图片、理解图表、回答视觉问题等所有维度上的表现都稳步攀升,图像生成质量也随之改善。这背后的道理,是语言中蕴含着关于这个世界的结构性知识——事物之间的关系、空间的逻辑、因果的链条——这些知识天然地为视觉任务打下地基。
视觉理解这位"二厨",对视觉生成有显著的催化作用。当视觉理解数据越多,模型生成图像的质量和文字与图像的对齐度都明显提升。道理也不难理解:能看懂一张图里有什么、空间关系是怎样的,自然也更懂得如何把这些元素画出来。然而,视觉理解对纯语言能力有轻微的负面影响——因为图文对数据集里的文字分布,和纯文本数据差异很大,就像让一个精通文学的人大量阅读说明书,他的文学感可能会稍有钝化。
最出人意料的是"三厨"视觉生成的角色。大量增加生成训练数据,对语言和视觉理解几乎没有帮助,既不提升也不拖累。视觉生成就像一位专注于出菜的厨师,自己的本职做好了,但没有能力反过来教会其他人新技能。
二、知识流动还取决于概念的"层次"——一个精妙的受控实验
真实世界的数据太复杂,各种因素纠缠在一起,很难说清楚到底是"哪类知识"在流动。于是研究团队设计了一个极为精妙的合成数据实验,用一个叫做CLEVR的程序化三维场景生成器,造出一批完全可控的训练数据。
这个实验的思路是"缺席实验":把某个概念(比如"黄色"这种颜色)从视觉生成的训练数据中完全抹去,但在视觉理解的训练数据中保留;然后测试模型能否通过视觉理解学到的知识,零样本地在生成任务中画出黄色物体。反过来,也把"黄色"从理解数据中抹去,保留在生成数据中,看看能不能通过生成训练来学会辨认黄色。
研究团队把概念分成两类。第一类是"低级属性",即颜色和形状——这两类完全无法跨任务迁移。如果模型从没在生成训练里见过"黄色",那么即使在理解任务里大量接触了黄色,它也画不出黄色;反过来,从没在理解任务里见过"黄色",即使生成时大量画过黄色,它也认不出黄色。两个方向都是零分。这说明,颜色和形状这类贴近像素的感知特征,必须在每项任务中独立学习,无法共享。
第二类是"高级结构概念",即空间关系、大小比较、数量计数。这里出现了有趣的单向迁移:当模型通过理解任务学会了"A在B的左后方"这种空间关系,它在生成任务中即使从未见过这个关系,也能有一定程度地画出来。但反过来,仅凭生成任务学习的空间关系,对理解任务几乎没有帮助。
更精彩的是对"潜在先验"的探究。对于那些完全无法零样本迁移的低级属性(颜色和形状),研究团队做了一个跟进实验:用少量含有这些概念的数据对模型进行微调,观察学习速度。结果发现,通过生成任务学过某种颜色的模型,在微调阶段学习理解该颜色的速度,明显快于什么都没学过的对照组。换句话说,生成训练虽然无法直接教会模型"认颜色",但它在模型内部留下了关于这种颜色像素特征的精细印记,一旦有机会和语言标签对接,就能迅速激活。这就像学过乐器的人学唱歌,虽然演奏和演唱是不同技能,但对音调的感知底层是相通的。
三、协作还是竞争——架构设计决定了命运
弄清楚了知识如何流动,下一个问题是:模型的内部结构,如何影响这种流动是变成协作还是竞争?
研究团队做了一系列任务复杂度实验。他们把视觉数据的复杂程度从最简单的纯色背景图逐步升级,经过几何图案、噪音图、带文字的图,直到真实自然图片;同时把语言数据从简单重复字母的"简单文字"逐步升级到完整的网络文章。
结论非常有规律:当某项任务极度简单时,它反而会帮助另一项任务。用纯色背景图训练视觉,语言建模的困惑度(一个衡量语言理解质量的指标,越低越好)比单独训练语言还要低——简单的视觉刺激像是一种"热身运动",帮助整个网络的表征能力提升。但当视觉任务换成复杂的真实图片,两者就开始争抢资源,语言能力反而比单独训练语言更差。语言任务对视觉的影响也遵循同样的规律:最简单的字母重复文本给视觉生成带来的提升最大,比复杂的真实文本更有效。
这个发现帮助研究团队理解了一个长期争议:为什么一些研究说多模态联合训练会改善理解,而另一些研究说没效果甚至有害?答案在于任务复杂度——简单任务促进协作,复杂任务引发竞争。
基于这个理解,研究团队对Transformer架构进行了解剖实验,精确定位协作与竞争的位置。一个Transformer模块由三部分组成:注意力机制(负责让不同位置的信息互相"看见"对方)、前馈网络(负责对每个位置的信息进行深度加工)和归一化层(负责稳定训练过程)。
当语言和视觉的词符完全共享所有参数时,也就是"密集模型",结果最差——两者激烈竞争,语言和视觉的表现都比单独训练更差。当仅仅把前馈网络拆分为语言和视觉各自独立的专属网络时,效果最好——语言困惑度提升了0.211,视觉生成损失也显著降低。如果同时把注意力机制也拆分,效果大幅缩水;如果把归一化层也拆分,效果进一步减弱;如果三层全部拆分,效果和完全独立训练没有区别。
这揭示了一条架构原则:注意力机制和归一化层是协作发生的地方,让语言和视觉信息在这里交汇,相互影响,产生正面的跨模态学习;而前馈网络是容易发生竞争的地方,给每种模态独立的计算容量,就能避免互相干扰。这正是为什么近年来的混合专家(MoE)模型——为不同模态分配不同的"专家"前馈网络——在实践中表现出色的理论依据。
研究团队在四种不同的视觉编码方式(语义特征编码、原始像素、独立理解与生成编码器、以及自回归离散编码)上都验证了上述规律,得出了一致的结论:这些协作与竞争的规律,并非某种特定视觉编码的专属特性,而是更普遍的多模态训练物理规律。
四、越早融合越好——"视觉懒惰"现象的发现
前三条规律告诉我们知识往哪里流、什么架构最好,但还有一个关键问题:什么时候开始引入视觉训练,重要吗?
直觉上,既然语言能力是视觉的"地基",那先把语言练好再加视觉,不是更合理吗?很多现有的多模态AI都是这么做的——先把一个强大的语言模型训练好,再对齐视觉能力。研究团队用实验彻底推翻了这个直觉。
他们固定总训练预算为1万亿词符,然后改变视觉数据被引入的时机——从一开始就联合训练,到先纯语言训练200亿、400亿、600亿、800亿词符再引入视觉。结果是:视觉引入得越晚,模型最终的视觉理解和视觉生成能力就越差,而且下降幅度相当显著。尽管推迟引入视觉在初期能带来一点语言能力的提升,但这个好处很快就饱和了,甚至消失;而视觉能力的损失却是持续且显著的。
他们还测试了另一个问题:把三种模态的训练分成独立阶段、依次进行,是否可行?无论以什么顺序——先语言后理解再生成,先生成后语言再理解,甚至模仿人类先有视觉再有语言的顺序——所有序列式训练方案,在视觉任务上都远差于从一开始就同时联合训练的方案。即使加入了"回放"机制(在当前阶段保留一部分之前阶段的数据,防止遗忘),也远不足以弥补这个差距。这说明三种模态需要的不仅仅是"共存",而是从一开始就"共同进化"。
为了理解为什么会这样,研究团队深入模型内部做了四项机制性测量,发现了一个他们命名为"视觉懒惰"的现象。
测量一:在训练过程中,视觉专用的前馈网络的激活幅度,随着语言预训练时间越长而越来越小。也就是说,视觉部分变得越来越"安静",参与度越来越低。测量二:标记图像开始和结束的特殊词符(类似于"这里开始是图片"和"图片结束"的标记),其嵌入向量的长度随语言预训练时间增长而缩小,说明语言通路变得越来越"固执",不愿意为图像腾出空间。测量三:推理时,视觉前馈网络的输出激活幅度也随语言预训练时间增长而降低,说明视觉分支真正参与计算的程度越来越低。测量四:推理时,模型的注意力放在图像词符上的比例,随语言预训练时间增长而下降——模型越来越倾向于忽视图片,转而依靠语言上下文来猜测答案。
四项指标指向同一个结论:语言训练越充分,模型在后来被迫加入视觉时,越倾向于"偷懒"——用已经很强大的语言推理能力来走捷径,而不真正去学习视觉特征。这就好比一个从小只学文字的优秀学生,突然被要求也学音乐,但他发现用语文逻辑推理出大部分音乐题目的答案成本更低,于是音乐鉴赏能力始终停留在表面,真正的听觉感知能力根本没有发展起来。这也解释了为什么很多现有的强大语言模型即使加了视觉能力,有时还是会犯一些明显的视觉错误,或者"假装看见了"实际上并没有认真看的东西。
五、把规律变成食谱——最优训练配方的推导
以上四条规律,最终汇聚成一套可以直接使用的训练配方。
既然知识流动是单向的——语言和视觉理解带动视觉生成,但生成不反哺理解——那么一个好的训练数据配方,应该把大头分配给语言和理解,而视觉生成只需要少量数据就够了,因为前者积累的知识会自动迁移给后者。
研究团队做了一次大规模的数据配比网格搜索,在语言数据占10%到90%之间,以及理解和生成之间不同比例的搭配,总共做了数十个1万亿词符的训练实验。结果显示,最优配方大约是:语言70%、视觉理解25%、视觉生成5%。在这个极度不对称的配比下,语言准确率和视觉理解分数都达到最高,而且视觉生成的质量(用文本与图像对齐度、组合生成准确率等多项指标衡量)也是同等最优——尽管生成数据只占5%,仅是常规"均等分配"方案的五分之一。用一个更直白的比方:这就好比你要同时学会写作、绘画和雕塑,最优策略不是三者各花三分之一的时间,而是大量时间写作(因为写作中的空间感、形态描述能力会迁移到绘画和雕塑),适量时间绘画,极少时间雕塑——因为绘画中学到的形态已经为雕塑打好了地基。
把这个配方与混合专家架构(MoE,即前馈网络按模态分开)以及从一开始就联合训练的策略结合起来,研究团队训练了一个130亿参数的混合专家模型,在2万亿词符上运行。通过与三个对照组(均衡配方、密集架构、晚期引入视觉)的逐项对比,每次只改变一个变量,他们确认了四条规律在大规模训练中全部成立:不对称配方的全面优越性,混合专家架构比密集架构更好,早期联合训练比晚期对齐更好。
归根结底,这篇研究做的事情,是给AI的多模态训练找到了几条不以人的意志为转移的"自然规律"。语言是视觉的地基,这一点不随架构变化;知识流动是单向的,你不能指望图像生成训练反哺语言能力;共享注意力是协作的桥梁,专属前馈网络是竞争的防火墙;越早融合越好,视觉懒惰一旦形成就难以弥补。
对普通用户而言,这意味着未来你用的那种"什么都会"的AI助手,能同时聊天、理解图片、生成图片,并不是靠堆砌三个独立模型拼在一起,而是通过从一开始就共同进化实现的。这种原生的融合,让它对图片的理解更深刻、生成的图片更忠实于你的文字描述,也更不容易犯那种"看了等于没看"的视觉错误。
而对AI研究者而言,这篇论文最重要的贡献,是把经验直觉变成了可以量化、可以复现的实验结论,给未来更大规模的多模态模型提供了一份有理论依据的设计指南。感兴趣的读者可以通过arXiv:2608.05000查阅完整论文,深入了解每个实验的细节设计与数据结果。
Q&A
Q1:为什么视觉生成训练对语言和视觉理解几乎没有帮助?
A:视觉生成训练的目标是"根据文字描述画出像素",这个过程要求模型学习的是密集的像素级特征,比如颜色分布、纹理细节等,但这类知识对于语言推理或图片内容识别帮助不大。研究团队用合成数据实验证明,生成任务学到的低级视觉特征无法直接被理解任务利用,两类任务所需的表征形式存在天然错位。不过,生成训练学到的这些特征并非毫无价值,当模型之后接触到少量理解任务数据时,它能更快地学会识别相关视觉概念,说明底层先验是有的,只是需要额外"桥接"才能被激活。
Q2:多模态模型为什么从一开始就要联合训练,后期再加视觉不行吗?
A:实验表明,语言训练时间越长,模型的"语言通路"越固化,后来引入视觉时会产生"视觉懒惰"——模型倾向于用强大的语言推理能力走捷径,而不认真学习视觉特征。研究通过四项内部机制测量(训练时和推理时的激活幅度、图像标记的嵌入大小、注意力放在图片上的比例)都一致证明,语言预训练越久,视觉通路的实际参与度越低,最终视觉能力显著更差。
Q3:混合专家架构(MoE)为什么比普通密集模型更适合多模态训练?
A:普通密集模型中,语言和视觉词符共享完全相同的前馈网络,而这两类信息的处理需求差异很大,强行共享会导致参数争夺,两者表现都下降。混合专家架构通过为不同模态分配专属的前馈网络专家,让每种模态有足够的独立计算容量,避免了这种干扰。与此同时,注意力机制和归一化层依然共享,这恰好保留了两种模态相互"看见"彼此、产生正面跨模态协作的通道。实验证明这是目前最优的参数共享策略组合。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.