网易首页 > 网易号 > 正文 申请入驻

独家|地平线余凯时隔10年发论文:统一语言视觉,16亿模型开源

0
分享至


2016年4月,由 新加坡国立大学计算机科学系教授陈树霖主导,联合还在百度深度学习研究院的余凯、黄畅等人,提出了Text Flow,在自然场景图像中统一文本检测技术。

十年后的今天,新一轮生成式AI大模型、世界模型爆发的背景下,地平线创始人余凯,地平线联合创始人黄畅,再度联手发表新的研究成果。

10月1日消息,智能纪元AGI独家获悉,今天,华中科技大学、北京交通大学与地平线机器人联合提出Multimodal Flow(MF‑1)。

这是一套开源的、完全连续的多模态生成框架,也是语言-视觉统一模型,最大特点是在嵌入空间中统一建模文本与图像,依靠 Flow Matching 实现语言、视觉共享同一套生成目标与采样流程,规避现有离散、混合范式的缺陷,从而为语言建模、视觉理解、图像生成、编辑、视频序列以及未来可表示为有序连续块的各种模态技术做基础AI技术能力。

MF‑1最大版本是1.6B(16亿)参数,只用了150B预训练Token。在 GenEval 上拿到82.8分,DPG-Bench 75.3分,超过了多个多模态模型的性能。


本论文通讯作者是华中科技大学电子信息与通信学院教授、Vision Lab团队负责人王兴刚。

参与的作者包括地平线创始人余凯,联合创始人黄畅等。

今年2月,地平线提出的端到端强化学习后训练范式RAD,也是基于地平线-华中科技大学计算机视觉联合实验室,由王兴刚团队与地平线团队联合研发。


我特意翻看了Google学术和Alphaxiv,2016年之后很少见余凯署名的论文。

那么,十年过去了,作为AI学术大牛,也是百度IDL和自动驾驶开拓者,如今还是一家上市公司创始人、董事长,余凯罕见参与的研究成果,到底做了哪些新的技术工作?

统一多模态,

把图像和文本都变成“超块”

今年5月,余凯在一个活动上说, 行业里什么VLA、VLM、End-to-End、世界模型,很多时候别扯这些词,商业意义大于实质。真正靠谱的团队,做的事情其实都差不多。

他指出,所谓世界模型,说到底也是一种仿真,用来生成大量虚拟数据,这件事并没有哪家不做。那些技术(路线)buzz word,很多时候成了车企老板和自媒体的谈资。真正还在牌桌上的玩家,技术路线并没有本质区别,细节才是魔鬼。

这其实体现出了一个余凯独特的技术思考:各种多模态模型需要统一,语言、动作和视觉需要有一个大一统的体系。

所以,过去两年,多模态和物理AI大模型的路线之争,本质上是一个问题:语言和图像,到底该不该用同一套“Token(词元)”来建模?

主流答案分两派。

一派是全离散路线:把图像也切成视觉 Token,和文本 Token 混在一起,丢进同一个自回归模型里。LWM、Show-o、Emu3-Gen、Muddit 都走这条路。

好处是统一,而坏处也很直接,图像量化是个信息瓶颈,细粒度细节在 Tokenizer 那一步就丢了,模型再强也找不回来。

另一派是混合路线:文本保持离散自回归,图像走连续扩散或流模型。Transfusion、JanusFlow、D-DIT 是代表。

这条路避开了量化损失,但代价是两套目标函数、两套采样流程,语言和视觉之间始终隔着一层“翻译”。

两条路都有道理,但都不彻底。


这次,华中科技大学、北京交通大学和地平线团队扔出了一个新方案:Multimodal Flow。


Multimodal Flow的回答很干脆,别切Token了,语言和图像都在连续嵌入空间里,用一条Flow Matching流统一建模。


所以,Multimodal Flow 的第一步,是给语言和视觉找一个共同的“连续表示空间”。

具体做法不复杂:

1、图像层面:用冻结的 SigLIP 2 编码器编码,再做层归一化,得到连续的视觉状态。每张图像形成一个"视觉超块"(visual hyperchunk)。

2、文本层面:用冻结的 T5-small 编码器编码,然后按固定长度分块(论文里B=8,也就是每 8 个Token一块),每块做层归一化,形成"文本超块"(text hyperchunk)。

再解释一下, 超块(hyperchunk)是这篇论文自己造的一个表示单元,核心在于,把文本和图像都切成“连续向量块”,用统一的粒度去建模。

注意这里的关键设计,文本超块保留了原始 Token 顺序,图像超块保留了空间结构。

模态特定的结构没有被抹平,只是被装进了统一的连续容器里。

然后,模态特定的输入投影层把这些超块映射到一个共同的隐藏空间,再加上模态嵌入和位置编码(MRoPE),就可以送进骨干网络了。

这个设计解决了统一多模态里最头疼的矛盾:既要共享生成过程,又要保留各自的表示结构。

之前的方案,要么牺牲图像细节(全离散),要么牺牲架构统一(混合),而Multimodal Flow 选择了第三条路。

那么,有了统一的超块序列,接下来的问题是:怎么建模?


Multimodal Flow 用的是一个chunk-causal(块因果)流骨干。

听起来抽象,拆开看其实很清楚:

第一,块因果注意力。

整个序列被看作有序的超块序列,联合分布按超块顺序分解。预测当前超块时,能看到所有之前的超块,但看不到未来的。这和自回归的因果掩码逻辑一致,但粒度是"块"而不是"Token"。

第二,联合注意力做跨模态交互。

文本和图像超块在同一个注意力空间里交互,不需要专门的跨注意力层。这意味着模型可以自然地处理"文本→图像""图像→文本""文本+图像→文本"等任意方向的条件生成。

第三,模态特定前馈网络(FFN)。

注意力是共享的,但 FFN 是分开的,文本超块走文本 FFN,视觉超块走视觉 FFN。论文做了消融实验,结论很明确:共享注意力投影+模态特定 FFN 是最优配置,共享 FFN 反而会拉低性能,尤其是文生图任务。

核心在于,跨模态的“关系”可以共享,但每种模态的“表示统计特性”不一样,需要各自的变换空间来适配。

值得一提的是,Multimodal Flow 用的是 Flow Matching 目标,在训练和推理阶段做了不一样设计。

比如,训练阶段采取并行方案,这意味着训练效率很高,不管序列多长,一次前向就能算完所有块的损失;而推理阶段是顺序的,给定前缀文本,下一个目标超块从高斯噪声开始初始化,把噪声逐步变成干净表示,生成完一个块,缓存它的 KV,再生成下一个。

这个“训练并行、推理顺序”的设计,和自回归模型的逻辑类似,但因为是连续流,每个块的生成本身是一个 ODE 积分过程,而不是一次性的 Token 采样。另外,模型还支持无分类器引导(CFG)。

混合预训练,

150B Token实验到底有多能打?

而Multimodal Flow最值得注意的设计之一,是它的混合多模态预训练,Mixed Multimodal Pretraining。

传统做法里,文本建模、图像生成、图文理解往往是分开训练或分阶段微调的。

但Multimodal Flow把这些任务全部统一到同一个 Flow Matching 目标下:

纯文本数据:文本块序列,每个块是无条件目标

纯图像数据:一个视觉超块,无条件生成

图文配对(文生图):文本前缀+视觉目标

图文配对(图生文):视觉前缀+文本目标

任务不同,但接口、因果结构、目标函数完全一样,变的只是块序列的顺序和目标模态,模型在一个混合分布里同时学语言建模、图像生成和跨模态对齐。

效果很直观。论文对比了随机初始化和混合预训练两种起点。


在相同的下游微调预算下,从结果可以看到,混合预训练给模型带来了全方位的飞跃。

比如,图像生成的组合能力指标 GenEval 从 0.527 暴涨至 0.821;考验长提示跟随能力的 DPG‑Bench,分数从 57.81 提升到 83.44。

多模态理解侧提升同样惊人。综合评测 SEED‑Bench 直接翻倍,从 31.6 来到 62.4;MMBench 理解分数从 36.0 提升至 67.2;需要外部知识的 OK‑VQA 视觉问答,也从 22.9 上涨到 39.1。

在模型结构、参数量、总训练 token 完全持平的前提下,仅仅增加多模态混合预训练阶段,不管是文生图生成能力,还是视觉问答、多模态理解,全部获得巨大增益。

这也证明了:Multimodal Flow 这套基于超块(hyperchunk)的连续流框架,通过混合预训练确实学到了可迁移的语言‑视觉联合表征,不是单纯靠堆下游数据“硬记样本”。

这说明一件事:语言建模和图像生成在连续流框架里是互相促进的,不是互相挤占的。

同时,论文做了三组对比,结论都很扎实。

第一组,和公开 SOTA 比。

1.6B 的 MF-1 在 GenEval 上 82.8 分,超过 LWM(7B,0.47)、Show-o(13B,0.53)、Emu3-Gen(8B,0.61)等全离散模型,也超过 JanusFlow(1.3B,0.67)、D-DIT(2B,0.65)等混合模型。DPG-Bench 上 75.3 分,同样领先。

这些对手的参数量和训练数据普遍更大,MF-1是以小博大。


第二组,同预算受控对比。

在完全相同的数据、训练调度和可训练参数预算下,Multimodal Flow(全连续)、Transfusion 风格(混合)、Chameleon 风格(全离散)对比,而全连续路线在五项指标上全部第一,而且领先幅度不小。

这个数据把架构本身的优势就显现出来了。


第三组,缩放实验。

0.6B、1.2B、1.6B 三个版本当中,随着模型增大,语言建模 PPL 持续下降,GenEval 和 CLIPScore 持续提升,没有出现饱和迹象。这意味着连续流框架的缩放规律是健康的,更大的模型还有空间。


回到开头的问题:语言和图像该不该用同一套"token"?

Multimodal Flow 的回答是:不该用同一套token词元,但可以用同一条流。

离散 Token 化的根本问题,是把连续的视觉信号硬塞进离散的符号系统里,信息损失不可逆。混合路线虽然避开了量化,但两套目标函数意味着语言和视觉的生成过程本质上还是两件事,只是被拼在了一起。

Multimodal Flow 做的事情是:保留各自的表示空间,但用同一个连续生成过程把它们串起来。

语言和图像不再需要“翻译”,因为它们从一开始就在同一个流里运动。而这个思路的影响可能超出多模态本身。如果连续流可以统一语言和视觉,那音频、视频、动作呢?

论文在结论里明确提到,扩展到更长的交错序列、视频和其他结构化模态是未来方向。

当然,MF-1 只有 1.6B 参数,150B 预训练 Token,和 GPT-4o、Gemini 这种级别的模型还不在一个量级。全连续路线在超长序列、多轮交错对话场景下的表现还需要验证。

Flow Matching 的推理速度和离散自回归相比如何,也是个实际问题。但这篇论文的价值不在于“又刷了几个榜”,而在于它证明了一件事:

统一多模态建模不一定需要离散化,连续流是一条可行且有竞争力的路。

在整个行业都在往"大一统模型"冲的时候,余凯和王兴刚团队提出的研究,多了一条被验证过的技术路线,本身就是意义。

代码开源地址:github.com/hustvl/Multimodal-Flow

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
台舰水炮射击“国旗”和钓鱼船

台舰水炮射击“国旗”和钓鱼船

让生活充满温暖
2026-10-03 02:37:46
国庆第一批血亏的生意出现!卷到50元还没人住,年轻人不想当韭菜

国庆第一批血亏的生意出现!卷到50元还没人住,年轻人不想当韭菜

体育小柚
2026-10-03 12:36:20
景甜私密照:眼神迷离躺床上,重要部位打马赛克!

景甜私密照:眼神迷离躺床上,重要部位打马赛克!

默默有话说
2026-10-01 19:55:11
菲方急疯:破船25天没补给了,但更要命的是破船正在海底烂穿

菲方急疯:破船25天没补给了,但更要命的是破船正在海底烂穿

浯江孤舟
2026-10-03 10:35:32
黔西南二十四道拐被指圈路收费,景区:属抗战文物不对社会通行

黔西南二十四道拐被指圈路收费,景区:属抗战文物不对社会通行

澎湃新闻
2026-10-02 20:04:06
深度长文:为什么我们总觉得癌症治不好?

深度长文:为什么我们总觉得癌症治不好?

宇宙时空
2026-10-02 18:43:42
17所985惨遭淘汰!双非大学0上榜!冲上热搜

17所985惨遭淘汰!双非大学0上榜!冲上热搜

史海流年号
2026-10-01 10:24:10
国庆燃油SUV大跳水!最高直降49%,7万起买途岳真不是段子

国庆燃油SUV大跳水!最高直降49%,7万起买途岳真不是段子

刘哥谈体育
2026-10-03 00:31:52
美媒:首批F-16V战斗机安全抵达中国台湾地区,交付时间耐人寻味

美媒:首批F-16V战斗机安全抵达中国台湾地区,交付时间耐人寻味

零度Military
2026-10-03 08:55:08
央视怒批、空有皮囊、德不配位,难怪国庆大场面不请“流量明星”

央视怒批、空有皮囊、德不配位,难怪国庆大场面不请“流量明星”

史之韵
2026-10-03 19:21:25
情商低别硬上综艺,《现在就出发 4》的他,被沈腾、胡先煦轮流怼

情商低别硬上综艺,《现在就出发 4》的他,被沈腾、胡先煦轮流怼

娱圈办事处
2026-10-03 14:42:37
赵松源:这国家队,我还是回去念书吧

赵松源:这国家队,我还是回去念书吧

中场阴谋家
2026-10-03 15:57:34
港澳豪门一个没到,四太的500人答谢宴到底在办给谁看?

港澳豪门一个没到,四太的500人答谢宴到底在办给谁看?

喜欢历史的阿繁
2026-10-03 06:15:07
景甜写真曝光,评论区:孙哥可没少摸!

景甜写真曝光,评论区:孙哥可没少摸!

默默有话说
2026-10-03 13:47:57
河南延津一男子吸烟喝酒脑梗后哭着给媳妇道歉:对不起媳妇,我错了!应该早听话戒烟戒酒

河南延津一男子吸烟喝酒脑梗后哭着给媳妇道歉:对不起媳妇,我错了!应该早听话戒烟戒酒

潇湘晨报
2026-10-03 12:21:10
林志玲最新视频认不出,眼窝凹陷,面相苦,网友辣评:医美后遗症来了

林志玲最新视频认不出,眼窝凹陷,面相苦,网友辣评:医美后遗症来了

全球风情大揭秘
2026-10-02 00:55:40
“一米穿五界”,余承东尴尬了

“一米穿五界”,余承东尴尬了

大厂财经社
2026-10-02 17:04:59
男子吐槽:垃圾不敢白天扔,怕捡垃圾的那群人,把业主隐私扒精光

男子吐槽:垃圾不敢白天扔,怕捡垃圾的那群人,把业主隐私扒精光

四海神君
2026-10-02 19:00:07
“我不会结婚”北京理工女大学生语出惊人:穷人生孩子是不负责任

“我不会结婚”北京理工女大学生语出惊人:穷人生孩子是不负责任

蹲坑看世界
2026-10-03 05:40:38
离大谱!买RTX 5090要签保证书:禁止转售、离境

离大谱!买RTX 5090要签保证书:禁止转售、离境

快科技
2026-10-03 09:55:08
2026-10-03 20:39:00
智能纪元AGI
智能纪元AGI
专注科技、科学、商业产业报道
2649文章数 10613关注度
往期回顾 全部

科技要闻

英伟达盘中创历史新高,市值逼近6万亿美元

头条要闻

美国女囚死刑执行到打呼 已成植物人"死不成又活不了"

头条要闻

美国女囚死刑执行到打呼 已成植物人"死不成又活不了"

体育要闻

这个讨论了一夏天的问题,马刺有答案了吗

娱乐要闻

马思纯一家爬山祈福!素颜出镜笑容甜

财经要闻

4亿台电视挂墙落灰 为何没人愿意开了?

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

家居
健康
教育
房产
时尚

家居要闻

2026建博会(广州) 公装联探展交流活动

刷酸祛痘,为什么有人翻车?

教育要闻

选专业别只追“热门”:数字时代,这4个方向值得重点了解

房产要闻

保利大爆发,冲到榜一!海南楼市前三季度,热销榜出炉!

Chemena Kamali写给Chloé的又一封情书

无障碍浏览 进入关怀版