网易首页 > 网易号 > 正文 申请入驻

独家|地平线创始人余凯时隔10年发论文:统一语言视觉模型开源

0
分享至



2016年4月,由新加坡国立大学计算机科学系教授陈树霖主导,联合还在百度深度学习研究院的余凯、黄畅等人,提出了Text Flow,在自然场景图像中统一文本检测技术。

十年后的今天,新一轮生成式AI大模型、世界模型爆发的背景下,地平线创始人余凯,地平线联合创始人黄畅,再度联手发表新的研究成果。

10月1日消息,智能纪元AGI独家获悉,今天,华中科技大学、北京交通大学与地平线机器人联合提出Multimodal Flow(MF‑1)。

这是一套开源的、完全连续的多模态生成框架,也是语言-视觉统一模型,最大特点是在嵌入空间中统一建模文本与图像,依靠 Flow Matching 实现语言、视觉共享同一套生成目标与采样流程,规避现有离散、混合范式的缺陷,从而为语言建模、视觉理解、图像生成、编辑、视频序列以及未来可表示为有序连续块的各种模态技术做基础AI技术能力。

MF‑1最大版本是1.6B(16亿)参数,只用了150B预训练Token。在 GenEval 上拿到82.8分,DPG-Bench 75.3分,超过了多个多模态模型的性能。



本论文通讯作者是华中科技大学电子信息与通信学院教授、Vision Lab团队负责人王兴刚。

参与的作者包括地平线创始人余凯,联合创始人黄畅等。

今年2月,地平线提出的端到端强化学习后训练范式RAD,也是基于地平线-华中科技大学计算机视觉联合实验室,由王兴刚团队与地平线团队联合研发。



我特意翻看了Google学术和Alphaxiv,2016年之后很少见余凯署名的论文。

那么,十年过去了,作为AI学术大牛,也是百度IDL和自动驾驶开拓者,如今还是一家上市公司创始人、董事长,余凯罕见参与的研究成果,到底做了哪些新的技术工作?

统一多模态,

把图像和文本都变成“超块”

今年5月,余凯在一个活动上说,行业里什么VLA、VLM、End-to-End、世界模型,很多时候别扯这些词,商业意义大于实质。真正靠谱的团队,做的事情其实都差不多。

他指出,所谓世界模型,说到底也是一种仿真,用来生成大量虚拟数据,这件事并没有哪家不做。那些技术(路线)buzz word,很多时候成了车企老板和自媒体的谈资。真正还在牌桌上的玩家,技术路线并没有本质区别,细节才是魔鬼。

这其实体现出了一个余凯独特的技术思考:各种多模态模型需要统一,语言、动作和视觉需要有一个大一统的体系。

所以,过去两年,多模态和物理AI大模型的路线之争,本质上是一个问题:语言和图像,到底该不该用同一套“Token(词元)”来建模?

主流答案分两派。

一派是全离散路线:把图像也切成视觉 Token,和文本 Token 混在一起,丢进同一个自回归模型里。LWM、Show-o、Emu3-Gen、Muddit 都走这条路。

好处是统一,而坏处也很直接,图像量化是个信息瓶颈,细粒度细节在 Tokenizer 那一步就丢了,模型再强也找不回来。

另一派是混合路线:文本保持离散自回归,图像走连续扩散或流模型。Transfusion、JanusFlow、D-DIT 是代表。

这条路避开了量化损失,但代价是两套目标函数、两套采样流程,语言和视觉之间始终隔着一层“翻译”。

两条路都有道理,但都不彻底。



这次,华中科技大学、北京交通大学和地平线团队扔出了一个新方案:Multimodal Flow。



Multimodal Flow的回答很干脆,别切Token了,语言和图像都在连续嵌入空间里,用一条Flow Matching流统一建模。



所以,Multimodal Flow 的第一步,是给语言和视觉找一个共同的“连续表示空间”。

具体做法不复杂:

1、图像层面:用冻结的 SigLIP 2 编码器编码,再做层归一化,得到连续的视觉状态。每张图像形成一个"视觉超块"(visual hyperchunk)。

2、文本层面:用冻结的 T5-small 编码器编码,然后按固定长度分块(论文里B=8,也就是每 8 个Token一块),每块做层归一化,形成"文本超块"(text hyperchunk)。

再解释一下,超块(hyperchunk)是这篇论文自己造的一个表示单元,核心在于,把文本和图像都切成“连续向量块”,用统一的粒度去建模。

注意这里的关键设计,文本超块保留了原始 Token 顺序,图像超块保留了空间结构。

模态特定的结构没有被抹平,只是被装进了统一的连续容器里。

然后,模态特定的输入投影层把这些超块映射到一个共同的隐藏空间,再加上模态嵌入和位置编码(MRoPE),就可以送进骨干网络了。

这个设计解决了统一多模态里最头疼的矛盾:既要共享生成过程,又要保留各自的表示结构。

之前的方案,要么牺牲图像细节(全离散),要么牺牲架构统一(混合),而Multimodal Flow 选择了第三条路。

那么,有了统一的超块序列,接下来的问题是:怎么建模?



Multimodal Flow 用的是一个chunk-causal(块因果)流骨干。

听起来抽象,拆开看其实很清楚:

第一,块因果注意力。

整个序列被看作有序的超块序列,联合分布按超块顺序分解。预测当前超块时,能看到所有之前的超块,但看不到未来的。这和自回归的因果掩码逻辑一致,但粒度是"块"而不是"Token"。

第二,联合注意力做跨模态交互。

文本和图像超块在同一个注意力空间里交互,不需要专门的跨注意力层。这意味着模型可以自然地处理"文本→图像""图像→文本""文本+图像→文本"等任意方向的条件生成。

第三,模态特定前馈网络(FFN)。

注意力是共享的,但 FFN 是分开的,文本超块走文本 FFN,视觉超块走视觉 FFN。论文做了消融实验,结论很明确:共享注意力投影+模态特定 FFN 是最优配置,共享 FFN 反而会拉低性能,尤其是文生图任务。

核心在于,跨模态的“关系”可以共享,但每种模态的“表示统计特性”不一样,需要各自的变换空间来适配。

值得一提的是,Multimodal Flow 用的是 Flow Matching 目标,在训练和推理阶段做了不一样设计。

比如,训练阶段采取并行方案,这意味着训练效率很高,不管序列多长,一次前向就能算完所有块的损失;而推理阶段是顺序的,给定前缀文本,下一个目标超块从高斯噪声开始初始化,把噪声逐步变成干净表示,生成完一个块,缓存它的 KV,再生成下一个。

这个“训练并行、推理顺序”的设计,和自回归模型的逻辑类似,但因为是连续流,每个块的生成本身是一个 ODE 积分过程,而不是一次性的 Token 采样。另外,模型还支持无分类器引导(CFG)。

混合预训练,

150B Token实验到底有多能打?

而Multimodal Flow最值得注意的设计之一,是它的混合多模态预训练,Mixed Multimodal Pretraining。

传统做法里,文本建模、图像生成、图文理解往往是分开训练或分阶段微调的。

但Multimodal Flow把这些任务全部统一到同一个 Flow Matching 目标下:

纯文本数据:文本块序列,每个块是无条件目标

纯图像数据:一个视觉超块,无条件生成

图文配对(文生图):文本前缀+视觉目标

图文配对(图生文):视觉前缀+文本目标

任务不同,但接口、因果结构、目标函数完全一样,变的只是块序列的顺序和目标模态,模型在一个混合分布里同时学语言建模、图像生成和跨模态对齐。

效果很直观。论文对比了随机初始化和混合预训练两种起点。



在相同的下游微调预算下,从结果可以看到,混合预训练给模型带来了全方位的飞跃。

比如,图像生成的组合能力指标 GenEval 从 0.527 暴涨至 0.821;考验长提示跟随能力的 DPG‑Bench,分数从 57.81 提升到 83.44。

多模态理解侧提升同样惊人。综合评测 SEED‑Bench 直接翻倍,从 31.6 来到 62.4;MMBench 理解分数从 36.0 提升至 67.2;需要外部知识的 OK‑VQA 视觉问答,也从 22.9 上涨到 39.1。

在模型结构、参数量、总训练 token 完全持平的前提下,仅仅增加多模态混合预训练阶段,不管是文生图生成能力,还是视觉问答、多模态理解,全部获得巨大增益。

这也证明了:Multimodal Flow 这套基于超块(hyperchunk)的连续流框架,通过混合预训练确实学到了可迁移的语言‑视觉联合表征,不是单纯靠堆下游数据“硬记样本”。

这说明一件事:语言建模和图像生成在连续流框架里是互相促进的,不是互相挤占的。

同时,论文做了三组对比,结论都很扎实。

第一组,和公开 SOTA 比。

1.6B 的 MF-1 在 GenEval 上 82.8 分,超过 LWM(7B,0.47)、Show-o(13B,0.53)、Emu3-Gen(8B,0.61)等全离散模型,也超过 JanusFlow(1.3B,0.67)、D-DIT(2B,0.65)等混合模型。DPG-Bench 上 75.3 分,同样领先。

这些对手的参数量和训练数据普遍更大,MF-1是以小博大。



第二组,同预算受控对比。

在完全相同的数据、训练调度和可训练参数预算下,Multimodal Flow(全连续)、Transfusion 风格(混合)、Chameleon 风格(全离散)对比,而全连续路线在五项指标上全部第一,而且领先幅度不小。

这个数据把架构本身的优势就显现出来了。



第三组,缩放实验。

0.6B、1.2B、1.6B 三个版本当中,随着模型增大,语言建模 PPL 持续下降,GenEval 和 CLIPScore 持续提升,没有出现饱和迹象。这意味着连续流框架的缩放规律是健康的,更大的模型还有空间。



回到开头的问题:语言和图像该不该用同一套"token"?

Multimodal Flow 的回答是:不该用同一套token词元,但可以用同一条流。

离散 Token 化的根本问题,是把连续的视觉信号硬塞进离散的符号系统里,信息损失不可逆。混合路线虽然避开了量化,但两套目标函数意味着语言和视觉的生成过程本质上还是两件事,只是被拼在了一起。

Multimodal Flow 做的事情是:保留各自的表示空间,但用同一个连续生成过程把它们串起来。

语言和图像不再需要“翻译”,因为它们从一开始就在同一个流里运动。而这个思路的影响可能超出多模态本身。如果连续流可以统一语言和视觉,那音频、视频、动作呢?

论文在结论里明确提到,扩展到更长的交错序列、视频和其他结构化模态是未来方向。

当然,MF-1 只有 1.6B 参数,150B 预训练 Token,和 GPT-4o、Gemini 这种级别的模型还不在一个量级。全连续路线在超长序列、多轮交错对话场景下的表现还需要验证。

Flow Matching 的推理速度和离散自回归相比如何,也是个实际问题。但这篇论文的价值不在于“又刷了几个榜”,而在于它证明了一件事:

统一多模态建模不一定需要离散化,连续流是一条可行且有竞争力的路。

在整个行业都在往"大一统模型"冲的时候,余凯和王兴刚团队提出的研究,多了一条被验证过的技术路线,本身就是意义。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
迪拜航空安全事件更多细节披露:机上另两名飞行员控制飞机

迪拜航空安全事件更多细节披露:机上另两名飞行员控制飞机

北青网-北京青年报
2026-10-03 14:58:04
特朗普登上联合国大会讲台,抬手直指秘书长古特雷斯;中国6.85亿美元会费悄然到账

特朗普登上联合国大会讲台,抬手直指秘书长古特雷斯;中国6.85亿美元会费悄然到账

谈史论今1
2026-10-02 20:48:36
事态已经全面升级!赖清德有可能成为新中国历史上,唯一一位在任台湾地区领导人中出现重大变故的人物

事态已经全面升级!赖清德有可能成为新中国历史上,唯一一位在任台湾地区领导人中出现重大变故的人物

人生录
2026-09-11 00:05:21
伊拉克宣布实现国家完全主权

伊拉克宣布实现国家完全主权

新华社
2026-10-01 20:28:10
中使馆:此案是国际社会前所未闻的恶性事件,日方如何处理,中方拭目以待

中使馆:此案是国际社会前所未闻的恶性事件,日方如何处理,中方拭目以待

南方都市报
2026-10-03 09:17:36
阿根廷推出“投资换国籍”计划:申请入籍者需要向阿根廷直接投资至少35万美元,且不可退还,或购买80万美元公共债券

阿根廷推出“投资换国籍”计划:申请入籍者需要向阿根廷直接投资至少35万美元,且不可退还,或购买80万美元公共债券

政知新媒体
2026-10-03 15:08:28
性感穿搭的我,能迷死万千少男吗?

性感穿搭的我,能迷死万千少男吗?

疾跑的小蜗牛
2026-10-03 16:58:53
肚子总是咕咕叫、放屁多?提醒:多半与6个原因有关,别不当回事

肚子总是咕咕叫、放屁多?提醒:多半与6个原因有关,别不当回事

王二哥老搞笑
2026-10-03 07:24:22
江苏富豪重金为痴傻儿子娶妻,拜金女孩欣然答应,新婚当晚却愣住

江苏富豪重金为痴傻儿子娶妻,拜金女孩欣然答应,新婚当晚却愣住

温情邮局
2025-07-09 14:39:26
因为“真有人用”,所以取消了所有福利?这波操作太真实了

因为“真有人用”,所以取消了所有福利?这波操作太真实了

夜深爱杂谈
2026-10-03 20:30:57
大瓜!裴小姐的老公,也出事了!

大瓜!裴小姐的老公,也出事了!

财经要参
2026-10-02 22:14:38
46岁高圆圆素颜穿塑料凉拖逛超市,被路人当成买菜大姐

46岁高圆圆素颜穿塑料凉拖逛超市,被路人当成买菜大姐

东方不败然多多
2026-10-01 20:30:13
最后一笔 100 亿美元汇出去了!孙正义,彻底把命押给了美国!

最后一笔 100 亿美元汇出去了!孙正义,彻底把命押给了美国!

荐史
2026-10-03 13:59:56
伊朗是脸不要了,还是底裤不要了!

伊朗是脸不要了,还是底裤不要了!

廖保平
2026-10-01 09:14:40
北美夺冠,海外票房破13.4亿!陈思诚国庆档冠军的对手来了?​

北美夺冠,海外票房破13.4亿!陈思诚国庆档冠军的对手来了?​

靠谱电影君
2026-10-03 21:06:24
舅舅宴请全家族唯独漏掉我爸妈,我停掉母亲副卡,结账时舅舅愣住

舅舅宴请全家族唯独漏掉我爸妈,我停掉母亲副卡,结账时舅舅愣住

观观说事
2026-10-03 14:30:06
进球后拇指朝下!巴勒斯坦王牌中文致歉:没有不尊重国足+中国人民

进球后拇指朝下!巴勒斯坦王牌中文致歉:没有不尊重国足+中国人民

我爱英超
2026-10-03 16:54:09
明日亚运看点:多项赛事迎来决战,中国军团全力冲刺奖牌

明日亚运看点:多项赛事迎来决战,中国军团全力冲刺奖牌

林子说事
2026-10-03 00:31:24
国足点球大战前:刘浩帆主动请缨,李昊称“最后怎么打都赢”

国足点球大战前:刘浩帆主动请缨,李昊称“最后怎么打都赢”

懂球帝
2026-10-03 18:03:15
没有退路!中国国防部已经向全世界亮明:解放军全员整装待发。

没有退路!中国国防部已经向全世界亮明:解放军全员整装待发。

小马姨
2026-09-25 20:41:19
2026-10-03 21:44:49
智能纪元AGI
智能纪元AGI
专注科技、科学、商业产业报道
2649文章数 10613关注度
往期回顾 全部

科技要闻

英伟达盘中创历史新高,市值逼近6万亿美元

头条要闻

媒体:韩国酵母的风 还是吹到了日本

头条要闻

媒体:韩国酵母的风 还是吹到了日本

体育要闻

这个讨论了一夏天的问题,马刺有答案了吗

娱乐要闻

马思纯一家爬山祈福!素颜出镜笑容甜

财经要闻

4亿台电视挂墙落灰 为何没人愿意开了?

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

艺术
房产
亲子
公开课
军事航空

艺术要闻

马岩松设计!上海“方舟”,实景和效果图有多像?

房产要闻

保利大爆发,冲到榜一!海南楼市前三季度,热销榜出炉!

亲子要闻

只要有好奇心的,就不会活的太差

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

美国被指正向中东派遣第三艘航母

无障碍浏览 进入关怀版