网易首页 > 网易号 > 正文 申请入驻

Meta与牛津大学联手揭秘:AI多模态训练究竟藏着什么"物理定律"?

0
分享至


这项由Meta AI研究院(FAIR)、Meta现实实验室(Reality Labs)与英国牛津大学联合开展的研究,于2026年8月发表,论文编号为arXiv:2608.05000,感兴趣的读者可通过该编号查询完整原文。

如果把现代AI的发展比作一场厨艺进化之旅,那么最初的AI只会做一道菜——要么读懂文字,要么辨认图片。但今天的顶级AI厨师,已经能在同一口锅里同时炖语言、视觉理解与图像生成三道料理。问题是:这三道料理同锅炖煮,到底是相互提味,还是互相抢味?锅的大小怎么分配?下料的顺序有没有讲究?这些问题,就是这篇论文想回答的核心。

研究团队把这套探索过程称为"多模态预训练的物理学",意思是:就像物理学研究万物运行的基本规律一样,他们想找到AI多模态训练背后那些不变的、可预测的基本规律。他们通过大量精心设计的受控实验——既在真实的大规模网络数据上测试,也在人工合成的高度可控数据集上验证——系统性地解剖了语言、视觉理解与视觉生成这三者之间的关系。最终,他们整理出四条核心规律,并用一个130亿参数、在2万亿个词符上训练的巨型模型加以验证。

一、三种能力同锅炖,到底谁提味、谁抢味?

要理解这项研究,先得搞清楚现代"通用AI"在做什么。一个所谓的"统一多模态模型",同时承担三项任务:一是纯语言理解,就像读书看报;二是视觉理解,也就是看图说话,把图片翻译成文字;三是视觉生成,即根据文字描述画出图片。

研究团队想知道的是:这三项任务之间,知识是如何流动的?好比三个厨师共用一个灶台,他们的烹饪动作会不会互相影响?

研究的第一个发现,是流动是单向的、不对称的。语言这位"老师傅",对另外两个厨师都有巨大帮助——越多的语言训练数据,视觉理解和视觉生成的表现都会单调递增地提升。具体来说,当语言数据占比从0%提升到80%时,AI在识别图片、理解图表、回答视觉问题等所有维度上的表现都稳步攀升,图像生成质量也随之改善。这背后的道理,是语言中蕴含着关于这个世界的结构性知识——事物之间的关系、空间的逻辑、因果的链条——这些知识天然地为视觉任务打下地基。

视觉理解这位"二厨",对视觉生成有显著的催化作用。当视觉理解数据越多,模型生成图像的质量和文字与图像的对齐度都明显提升。道理也不难理解:能看懂一张图里有什么、空间关系是怎样的,自然也更懂得如何把这些元素画出来。然而,视觉理解对纯语言能力有轻微的负面影响——因为图文对数据集里的文字分布,和纯文本数据差异很大,就像让一个精通文学的人大量阅读说明书,他的文学感可能会稍有钝化。

最出人意料的是"三厨"视觉生成的角色。大量增加生成训练数据,对语言和视觉理解几乎没有帮助,既不提升也不拖累。视觉生成就像一位专注于出菜的厨师,自己的本职做好了,但没有能力反过来教会其他人新技能。

二、知识流动还取决于概念的"层次"——一个精妙的受控实验

真实世界的数据太复杂,各种因素纠缠在一起,很难说清楚到底是"哪类知识"在流动。于是研究团队设计了一个极为精妙的合成数据实验,用一个叫做CLEVR的程序化三维场景生成器,造出一批完全可控的训练数据。

这个实验的思路是"缺席实验":把某个概念(比如"黄色"这种颜色)从视觉生成的训练数据中完全抹去,但在视觉理解的训练数据中保留;然后测试模型能否通过视觉理解学到的知识,零样本地在生成任务中画出黄色物体。反过来,也把"黄色"从理解数据中抹去,保留在生成数据中,看看能不能通过生成训练来学会辨认黄色。

研究团队把概念分成两类。第一类是"低级属性",即颜色和形状——这两类完全无法跨任务迁移。如果模型从没在生成训练里见过"黄色",那么即使在理解任务里大量接触了黄色,它也画不出黄色;反过来,从没在理解任务里见过"黄色",即使生成时大量画过黄色,它也认不出黄色。两个方向都是零分。这说明,颜色和形状这类贴近像素的感知特征,必须在每项任务中独立学习,无法共享。

第二类是"高级结构概念",即空间关系、大小比较、数量计数。这里出现了有趣的单向迁移:当模型通过理解任务学会了"A在B的左后方"这种空间关系,它在生成任务中即使从未见过这个关系,也能有一定程度地画出来。但反过来,仅凭生成任务学习的空间关系,对理解任务几乎没有帮助。

更精彩的是对"潜在先验"的探究。对于那些完全无法零样本迁移的低级属性(颜色和形状),研究团队做了一个跟进实验:用少量含有这些概念的数据对模型进行微调,观察学习速度。结果发现,通过生成任务学过某种颜色的模型,在微调阶段学习理解该颜色的速度,明显快于什么都没学过的对照组。换句话说,生成训练虽然无法直接教会模型"认颜色",但它在模型内部留下了关于这种颜色像素特征的精细印记,一旦有机会和语言标签对接,就能迅速激活。这就像学过乐器的人学唱歌,虽然演奏和演唱是不同技能,但对音调的感知底层是相通的。

三、协作还是竞争——架构设计决定了命运

弄清楚了知识如何流动,下一个问题是:模型的内部结构,如何影响这种流动是变成协作还是竞争?

研究团队做了一系列任务复杂度实验。他们把视觉数据的复杂程度从最简单的纯色背景图逐步升级,经过几何图案、噪音图、带文字的图,直到真实自然图片;同时把语言数据从简单重复字母的"简单文字"逐步升级到完整的网络文章。

结论非常有规律:当某项任务极度简单时,它反而会帮助另一项任务。用纯色背景图训练视觉,语言建模的困惑度(一个衡量语言理解质量的指标,越低越好)比单独训练语言还要低——简单的视觉刺激像是一种"热身运动",帮助整个网络的表征能力提升。但当视觉任务换成复杂的真实图片,两者就开始争抢资源,语言能力反而比单独训练语言更差。语言任务对视觉的影响也遵循同样的规律:最简单的字母重复文本给视觉生成带来的提升最大,比复杂的真实文本更有效。

这个发现帮助研究团队理解了一个长期争议:为什么一些研究说多模态联合训练会改善理解,而另一些研究说没效果甚至有害?答案在于任务复杂度——简单任务促进协作,复杂任务引发竞争。

基于这个理解,研究团队对Transformer架构进行了解剖实验,精确定位协作与竞争的位置。一个Transformer模块由三部分组成:注意力机制(负责让不同位置的信息互相"看见"对方)、前馈网络(负责对每个位置的信息进行深度加工)和归一化层(负责稳定训练过程)。

当语言和视觉的词符完全共享所有参数时,也就是"密集模型",结果最差——两者激烈竞争,语言和视觉的表现都比单独训练更差。当仅仅把前馈网络拆分为语言和视觉各自独立的专属网络时,效果最好——语言困惑度提升了0.211,视觉生成损失也显著降低。如果同时把注意力机制也拆分,效果大幅缩水;如果把归一化层也拆分,效果进一步减弱;如果三层全部拆分,效果和完全独立训练没有区别。

这揭示了一条架构原则:注意力机制和归一化层是协作发生的地方,让语言和视觉信息在这里交汇,相互影响,产生正面的跨模态学习;而前馈网络是容易发生竞争的地方,给每种模态独立的计算容量,就能避免互相干扰。这正是为什么近年来的混合专家(MoE)模型——为不同模态分配不同的"专家"前馈网络——在实践中表现出色的理论依据。

研究团队在四种不同的视觉编码方式(语义特征编码、原始像素、独立理解与生成编码器、以及自回归离散编码)上都验证了上述规律,得出了一致的结论:这些协作与竞争的规律,并非某种特定视觉编码的专属特性,而是更普遍的多模态训练物理规律。

四、越早融合越好——"视觉懒惰"现象的发现

前三条规律告诉我们知识往哪里流、什么架构最好,但还有一个关键问题:什么时候开始引入视觉训练,重要吗?

直觉上,既然语言能力是视觉的"地基",那先把语言练好再加视觉,不是更合理吗?很多现有的多模态AI都是这么做的——先把一个强大的语言模型训练好,再对齐视觉能力。研究团队用实验彻底推翻了这个直觉。

他们固定总训练预算为1万亿词符,然后改变视觉数据被引入的时机——从一开始就联合训练,到先纯语言训练200亿、400亿、600亿、800亿词符再引入视觉。结果是:视觉引入得越晚,模型最终的视觉理解和视觉生成能力就越差,而且下降幅度相当显著。尽管推迟引入视觉在初期能带来一点语言能力的提升,但这个好处很快就饱和了,甚至消失;而视觉能力的损失却是持续且显著的。

他们还测试了另一个问题:把三种模态的训练分成独立阶段、依次进行,是否可行?无论以什么顺序——先语言后理解再生成,先生成后语言再理解,甚至模仿人类先有视觉再有语言的顺序——所有序列式训练方案,在视觉任务上都远差于从一开始就同时联合训练的方案。即使加入了"回放"机制(在当前阶段保留一部分之前阶段的数据,防止遗忘),也远不足以弥补这个差距。这说明三种模态需要的不仅仅是"共存",而是从一开始就"共同进化"。

为了理解为什么会这样,研究团队深入模型内部做了四项机制性测量,发现了一个他们命名为"视觉懒惰"的现象。

测量一:在训练过程中,视觉专用的前馈网络的激活幅度,随着语言预训练时间越长而越来越小。也就是说,视觉部分变得越来越"安静",参与度越来越低。测量二:标记图像开始和结束的特殊词符(类似于"这里开始是图片"和"图片结束"的标记),其嵌入向量的长度随语言预训练时间增长而缩小,说明语言通路变得越来越"固执",不愿意为图像腾出空间。测量三:推理时,视觉前馈网络的输出激活幅度也随语言预训练时间增长而降低,说明视觉分支真正参与计算的程度越来越低。测量四:推理时,模型的注意力放在图像词符上的比例,随语言预训练时间增长而下降——模型越来越倾向于忽视图片,转而依靠语言上下文来猜测答案。

四项指标指向同一个结论:语言训练越充分,模型在后来被迫加入视觉时,越倾向于"偷懒"——用已经很强大的语言推理能力来走捷径,而不真正去学习视觉特征。这就好比一个从小只学文字的优秀学生,突然被要求也学音乐,但他发现用语文逻辑推理出大部分音乐题目的答案成本更低,于是音乐鉴赏能力始终停留在表面,真正的听觉感知能力根本没有发展起来。这也解释了为什么很多现有的强大语言模型即使加了视觉能力,有时还是会犯一些明显的视觉错误,或者"假装看见了"实际上并没有认真看的东西。

五、把规律变成食谱——最优训练配方的推导

以上四条规律,最终汇聚成一套可以直接使用的训练配方。

既然知识流动是单向的——语言和视觉理解带动视觉生成,但生成不反哺理解——那么一个好的训练数据配方,应该把大头分配给语言和理解,而视觉生成只需要少量数据就够了,因为前者积累的知识会自动迁移给后者。

研究团队做了一次大规模的数据配比网格搜索,在语言数据占10%到90%之间,以及理解和生成之间不同比例的搭配,总共做了数十个1万亿词符的训练实验。结果显示,最优配方大约是:语言70%、视觉理解25%、视觉生成5%。在这个极度不对称的配比下,语言准确率和视觉理解分数都达到最高,而且视觉生成的质量(用文本与图像对齐度、组合生成准确率等多项指标衡量)也是同等最优——尽管生成数据只占5%,仅是常规"均等分配"方案的五分之一。用一个更直白的比方:这就好比你要同时学会写作、绘画和雕塑,最优策略不是三者各花三分之一的时间,而是大量时间写作(因为写作中的空间感、形态描述能力会迁移到绘画和雕塑),适量时间绘画,极少时间雕塑——因为绘画中学到的形态已经为雕塑打好了地基。

把这个配方与混合专家架构(MoE,即前馈网络按模态分开)以及从一开始就联合训练的策略结合起来,研究团队训练了一个130亿参数的混合专家模型,在2万亿词符上运行。通过与三个对照组(均衡配方、密集架构、晚期引入视觉)的逐项对比,每次只改变一个变量,他们确认了四条规律在大规模训练中全部成立:不对称配方的全面优越性,混合专家架构比密集架构更好,早期联合训练比晚期对齐更好。

归根结底,这篇研究做的事情,是给AI的多模态训练找到了几条不以人的意志为转移的"自然规律"。语言是视觉的地基,这一点不随架构变化;知识流动是单向的,你不能指望图像生成训练反哺语言能力;共享注意力是协作的桥梁,专属前馈网络是竞争的防火墙;越早融合越好,视觉懒惰一旦形成就难以弥补。

对普通用户而言,这意味着未来你用的那种"什么都会"的AI助手,能同时聊天、理解图片、生成图片,并不是靠堆砌三个独立模型拼在一起,而是通过从一开始就共同进化实现的。这种原生的融合,让它对图片的理解更深刻、生成的图片更忠实于你的文字描述,也更不容易犯那种"看了等于没看"的视觉错误。

而对AI研究者而言,这篇论文最重要的贡献,是把经验直觉变成了可以量化、可以复现的实验结论,给未来更大规模的多模态模型提供了一份有理论依据的设计指南。感兴趣的读者可以通过arXiv:2608.05000查阅完整论文,深入了解每个实验的细节设计与数据结果。

Q&A

Q1:为什么视觉生成训练对语言和视觉理解几乎没有帮助?

A:视觉生成训练的目标是"根据文字描述画出像素",这个过程要求模型学习的是密集的像素级特征,比如颜色分布、纹理细节等,但这类知识对于语言推理或图片内容识别帮助不大。研究团队用合成数据实验证明,生成任务学到的低级视觉特征无法直接被理解任务利用,两类任务所需的表征形式存在天然错位。不过,生成训练学到的这些特征并非毫无价值,当模型之后接触到少量理解任务数据时,它能更快地学会识别相关视觉概念,说明底层先验是有的,只是需要额外"桥接"才能被激活。

Q2:多模态模型为什么从一开始就要联合训练,后期再加视觉不行吗?

A:实验表明,语言训练时间越长,模型的"语言通路"越固化,后来引入视觉时会产生"视觉懒惰"——模型倾向于用强大的语言推理能力走捷径,而不认真学习视觉特征。研究通过四项内部机制测量(训练时和推理时的激活幅度、图像标记的嵌入大小、注意力放在图片上的比例)都一致证明,语言预训练越久,视觉通路的实际参与度越低,最终视觉能力显著更差。

Q3:混合专家架构(MoE)为什么比普通密集模型更适合多模态训练?

A:普通密集模型中,语言和视觉词符共享完全相同的前馈网络,而这两类信息的处理需求差异很大,强行共享会导致参数争夺,两者表现都下降。混合专家架构通过为不同模态分配专属的前馈网络专家,让每种模态有足够的独立计算容量,避免了这种干扰。与此同时,注意力机制和归一化层依然共享,这恰好保留了两种模态相互"看见"彼此、产生正面跨模态协作的通道。实验证明这是目前最优的参数共享策略组合。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
郭德纲被小人举报,丑陋一幕又出现了!

郭德纲被小人举报,丑陋一幕又出现了!

胖胖说他不胖
2026-08-13 16:53:58
从郭德纲被立案调查,看扣帽子的人是如何无所顾忌的

从郭德纲被立案调查,看扣帽子的人是如何无所顾忌的

清书先生
2026-08-13 16:14:59
央企开始施行“推恩令”了:不裁你、不赔你,四步逼你主动辞职

央企开始施行“推恩令”了:不裁你、不赔你,四步逼你主动辞职

白米饭怎么吃
2026-08-13 21:23:19
斗胆为郭德纲说几句

斗胆为郭德纲说几句

亮见
2026-08-13 15:27:12
不是运动员却花125亿美元买下湖人!Josh Kushner究竟是谁?

不是运动员却花125亿美元买下湖人!Josh Kushner究竟是谁?

体育硬核说
2026-08-13 00:48:47
领不到奖就黑脸、上手摸王骁还搂大鹏,没边界感还是别去百花奖了

领不到奖就黑脸、上手摸王骁还搂大鹏,没边界感还是别去百花奖了

祈福所有
2026-08-12 11:55:39
中国男篮5分险胜!乌拉圭主帅说这2人太出色,击败了我们所有努力

中国男篮5分险胜!乌拉圭主帅说这2人太出色,击败了我们所有努力

老吴说体育
2026-08-13 21:34:33
45岁拳王邹市明“听老婆的话”宣布复出,冉莹颖直言:“打赢了有钱花,打输了大不了换老公,还有保险拿”

45岁拳王邹市明“听老婆的话”宣布复出,冉莹颖直言:“打赢了有钱花,打输了大不了换老公,还有保险拿”

韩小娱
2026-08-13 17:37:16
世界杯夺冠梦碎!日本男足主帅森保一官宣离任,54岁名宿接任

世界杯夺冠梦碎!日本男足主帅森保一官宣离任,54岁名宿接任

岁月有情1314
2026-08-13 23:04:27
郭德纲篡改红歌被立案调查,澳洲坐拥巨额资产,铺好后路进退皆无忧

郭德纲篡改红歌被立案调查,澳洲坐拥巨额资产,铺好后路进退皆无忧

娱乐E君
2026-08-13 10:48:17
发现一个残忍真相:不管你多爱自己的儿女,不遗余力供他们上大学,把他们抚养成人,给他们最好的,他们也不一定会像你爱他们那样爱你

发现一个残忍真相:不管你多爱自己的儿女,不遗余力供他们上大学,把他们抚养成人,给他们最好的,他们也不一定会像你爱他们那样爱你

背包旅行
2026-08-11 17:47:55
胖东来房东坐地起价?别被带节奏了!算笔账:2.3万平一年2400万,每平每天才2.8元。随便一个商场都是3块起步,这价格简直是良心!

胖东来房东坐地起价?别被带节奏了!算笔账:2.3万平一年2400万,每平每天才2.8元。随便一个商场都是3块起步,这价格简直是良心!

谭谈社会
2026-08-13 11:56:46
俄最重要粮食出口枢纽之一遭夜袭,黑海港口两码头瘫痪 俄:摧毁乌502架无人机

俄最重要粮食出口枢纽之一遭夜袭,黑海港口两码头瘫痪 俄:摧毁乌502架无人机

红星新闻
2026-08-13 13:05:24
被红牌罚下!43岁前皇马少帅拒踢点球大战 率队离场:赶不上飞机了

被红牌罚下!43岁前皇马少帅拒踢点球大战 率队离场:赶不上飞机了

风过乡
2026-08-13 07:59:47
浩浩妈巨乳吸阳影游明日发售!买80份赠送双人拍立得

浩浩妈巨乳吸阳影游明日发售!买80份赠送双人拍立得

游民星空
2026-08-13 17:09:39
时隔2年出山!46岁哈维官宣出任荷兰队主帅 签约4年 首秀过招克洛普

时隔2年出山!46岁哈维官宣出任荷兰队主帅 签约4年 首秀过招克洛普

我爱英超
2026-08-13 05:13:56
日本美少女偶像官宣怀上第七胎,800万人送上祝福:她是想自己组个偶像团体吗?

日本美少女偶像官宣怀上第七胎,800万人送上祝福:她是想自己组个偶像团体吗?

玛丽姬丝
2026-08-13 19:34:07
最年轻新闻秘书,“弃特朗普而去”

最年轻新闻秘书,“弃特朗普而去”

中国新闻周刊
2026-08-13 20:55:23
郭德纲又遭举报,现已被立案调查,相声这行业真的没救了!

郭德纲又遭举报,现已被立案调查,相声这行业真的没救了!

News脑洞
2026-08-13 08:48:09
中日意见达成一致,高市终于做对了,台当局自不量力,丢脸丢大了

中日意见达成一致,高市终于做对了,台当局自不量力,丢脸丢大了

闻识
2026-08-13 00:36:43
2026-08-14 03:08:49
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9516文章数 568关注度
往期回顾 全部

科技要闻

一切皆插件!DeepSeek Harness正式发布

头条要闻

冉莹颖被指称“输了换老公有保险”邹市明深夜回应

头条要闻

冉莹颖被指称“输了换老公有保险”邹市明深夜回应

体育要闻

负债十几亿的联赛,还在疯狂买球星

娱乐要闻

篡改红歌已立案,郭德纲大祸临头

财经要闻

可治疗癌症?神话破灭的片仔癀 陷入争议

汽车要闻

全新红旗H7到底新在哪儿?

态度原创

艺术
游戏
家居
时尚
教育

艺术要闻

1水彩界最狠的“阴谋”:每一笔都是提前预谋,看完他们的建筑画,我再也不敢说自己懂艺术了!

曾为LPL夺S赛冠军,如今沦落登峰组9连败,Jiejie归队遭质疑!

家居要闻

2026建博会(广州) 公装联探展交流活动

HYROX赛场上的美照怎么拍出来的?

教育要闻

潍坊拟筹建一所普通本科高校!

无障碍浏览 进入关怀版