网易首页 > 网易号 > 正文 申请入驻

视觉理解和生成究竟能否相互促进?从视觉表征、任务到系统重新审视UMM

0
分享至



理解生成统一模型(Unified Multimodal Models, UMMs)正在成为多模态模型的重要发展方向。相比传统的理解模型 + 生成模型,UMM 希望在同一个模型中同时完成视觉理解和图像生成,让文本和图像能够在统一上下文中被理解、推理和生成。

但这里其实存在一个更基础的问题:

当视觉理解和生成被放进同一个模型之后,它们真的会互相帮助吗?

现有工作对此并没有给出一致答案。一方面,理解和生成可能共享视觉知识,从而形成正向迁移;另一方面,两种目标也可能竞争模型容量、产生表示冲突,最终只是功能上统一,却没有真正形成学习上的协同。

MMLab@南洋理工大学的最新论文《Uncovering Understanding–Generation Synergy in Native Unified Multimodal Models: From Representation, Task to System》,尝试在一个受控的原生多模场景下回答这一问题。



论文链接:https://arxiv.org/abs/2609.01607

为了避免引入额外的视觉表征先验,该研究选择在原生多模架构(pixel in, pixel out)下将视觉理解与生成之间的关系拆成三个层次:Representation → Task → System



表征层面:

理解和生成都会帮助对方

但简单共享反而可能产生冲突

首先,该论文研究了视觉理解任务和生成任务在不同架构下会如何影响彼此学习到的视觉表示。



实验发现了一个有意思的双向关系。



在 Dense Sharing 架构中,文本、用于理解的 clean visual tokens 和用于生成的 noised visual tokens 都经过同一套 LLM 参数。联合训练后,模型的视觉理解能力有所提升,但图像生成性能却出现下降。

进一步的 frozen feature probing 表明,加入生成训练后,用于视觉理解的 feature 在 ImageNet classification、ADE20K segmentation 和 NYUv2 depth estimation 等任务上表现更好。





也就是说:视觉生成任务可以帮助理解任务学习到更好的视觉表征

而当作者采用 modality-decoupled MoT,将视觉 token 放入单独的 visual branch 后,结果却恰好反过来:生成能力提升,理解能力下降。

进一步测量 text features 与 generative visual features 之间的 CKA 后发现,加入理解训练会显著增强二者的对齐关系:



视觉理解任务能够帮助生成任务的表征与文本表征更好地对齐

这说明,在表征层面理解和生成其实都能够给对方提供有价值的 learning signal。而问题在于:如果强迫两种目标使用同一套计算路径,其中一个目标很容易占据主导地位,另一个则退化成辅助监督

因此,论文进一步提出Task-decoupled MoT:理解视觉 token 继续进入 language-anchored branch,而生成视觉 token 使用 generation-specialized branch;与此同时,两条路径仍然通过文本语义和 shared attention 保持联系。

这种「部分 specialize、部分 share」的设计,避免了前两种架构中一边提升、一边退化的问题。

任务层面:

知识互通的理解与生成任务可以实现相互促进

解决 representation conflict 后,论文进一步提出一个更实际的问题:

什么样的理解任务和生成任务放在一起训练会相互促进?

决定二者能否相互促进的,是它们是否依赖相同的 underlying knowledge 或 capability。

论文分别选择了三个 case study:几何推理、SVG 和 3D Spatial Intelligence 来验证。

例如,在几何推理场景中,理解几何题需要识别图形中的实体、关系和约束,而生成或编辑几何图,同样需要模型掌握这些结构知识。



加入 geometric image generation 和 editing 任务后,不仅 Geometry3K、PGPS9K 等几何任务得到提升,收益还迁移到了 MathVerse 和 MathVista 等更一般的数学推理 benchmark。

作者进一步将把完全相同的 generation data 转换成 image description 等理解任务作为 baseline。结果显示,单纯增加相同来源的数据并不能带来同样的收益,说明学习如何生成一个满足几何约束的图形本身就是一种不同于语言描述的有效监督。

SVG 实验则更加直接。模型需要同时学习 Image→SVG 和 SVG→Image,两种方向本质上依赖同一个 vector structure。



联合训练后,Image→SVG 从 80.64 提升到 81.70,SVG→Image 从 80.21 提升到 86.52。论文通过进一步探究发现联合训练让模型从 SVG code 直接想象对应 icon 的能力大幅度提升。





类似的双向提升也出现在 3D spatial intelligence 中。联合训练在一系列 3D 空间智能相关的理解和生成任务上都得到了有效提高。

这些实验共同指向一个结论:

当理解和生成依赖共同的 latent knowledge 时,二者更容易形成真正的双向迁移。

系统层面:

既然可以串联两个模型

为什么还需要 UMM?

到了 system level,作者讨论了另一个很现实的问题。

如果已经有了单独的理解模型和生成模型,那么面对一个同时需要两种能力的复杂任务,完全可以采用 agentic pipeline 来组合专有模型来共同完成任务。

那么端到端 UMM 的优势到底是什么?

作者选择 reasoning-intensive image editing 任务进行严格的公平比较。给定 source image 和一个 implicit editing request,模型需要先理解图像和用户意图,再推理出具体修改内容,最后生成结果。

在相同 base model 和相同 task supervision 下,作者比较了模块化 Planner→Executor 与 End-to-end UMM。



结果显示,端到端模型在 RISEBench 和 KRIS-Bench 上都取得了更好的整体表现。

这说明,当理解、推理和生成需要紧密耦合时,统一模型的价值并不仅仅是「部署一个模型更方便」。

End-to-end optimization 本身可能就是能力来源的一部分

UMM 的真正价值

这项工作告诉我们:在合理的架构下,UMM 的价值来自那些真正同时需要理解和生成的任务

一种是在 task level,理解和生成共享底层知识与能力。例如在具身智能中,world modeling 与 policy/action learning 都依赖对环境状态、物理规律和动态变化的共同建模,所以 UMM 可以直接作为 VLA+WAM 的结合体,成为具身更好的基模。

另一种是在 system level,任务本身需要理解与生成持续交互,比如各类 agentic generation 和 通过视觉生成的 multimodal reasoning,都可以成为 UMM 原生的能力,从而相比于模块化的系统达到更高的上限和效率。



特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
爱吃榴莲有错吗?女子吐槽电焊丈夫不肯上交工资,自己每月仅仅吃十个榴莲才花两千,觉得丈夫太小气了

爱吃榴莲有错吗?女子吐槽电焊丈夫不肯上交工资,自己每月仅仅吃十个榴莲才花两千,觉得丈夫太小气了

捣蛋窝
2026-09-17 03:50:33
曼联高层向卡里克表达信任,但要求必须赢富勒姆!若其下课一巨头亦危险

曼联高层向卡里克表达信任,但要求必须赢富勒姆!若其下课一巨头亦危险

罗米的曼联博客
2026-09-18 11:06:05
《太平年》引越南全网热议:吴越国如越南独立,中国将失GDP大省

《太平年》引越南全网热议:吴越国如越南独立,中国将失GDP大省

小豫讲故事
2026-09-17 06:00:20
一个冷知识:为啥审计局一定要由政府一把手来分管?

一个冷知识:为啥审计局一定要由政府一把手来分管?

野望谷研究社
2026-09-18 11:49:39
伊朗代表跟沙特亲王,在北京当众吵了起来,都希望中方来评个对错

伊朗代表跟沙特亲王,在北京当众吵了起来,都希望中方来评个对错

慕容梓宜
2026-09-17 23:27:12
深夜,歹徒闯入家中对她施暴近两个小时,她咬紧牙关一声不吭,只为保护楼上熟睡的女儿。当警察破门而入时,才发现这位母亲早已浑身是血

深夜,歹徒闯入家中对她施暴近两个小时,她咬紧牙关一声不吭,只为保护楼上熟睡的女儿。当警察破门而入时,才发现这位母亲早已浑身是血

人生录
2026-07-30 00:05:11
大家发现没,王楚钦越来越不对劲,不是球技断崖下滑,也不是长相变化,而是精气神肉眼可见地被透支

大家发现没,王楚钦越来越不对劲,不是球技断崖下滑,也不是长相变化,而是精气神肉眼可见地被透支

乒乓助手
2026-08-21 00:37:44
住建部:房地产市场供求关系发生重大变化

住建部:房地产市场供求关系发生重大变化

财闻
2026-09-18 10:34:33
我退休金8500,找了个53岁老伴,刚从民政局出来,他女儿就守在门口:阿姨,有件事你能帮我吗?

我退休金8500,找了个53岁老伴,刚从民政局出来,他女儿就守在门口:阿姨,有件事你能帮我吗?

春江小历史
2026-09-17 17:59:55
伦纳德:我不是那种为了追戒指 就设法加盟夺冠概率最高球队的人

伦纳德:我不是那种为了追戒指 就设法加盟夺冠概率最高球队的人

北青网-北京青年报
2026-09-17 19:57:02
日媒:日本代表队亚运会邮轮住宿安排混乱,甚至出现男女同住

日媒:日本代表队亚运会邮轮住宿安排混乱,甚至出现男女同住

懂球帝
2026-09-18 01:18:43
多问一嘴真的能改变命运!网友:真心佩服这种脑子灵光转得快的人

多问一嘴真的能改变命运!网友:真心佩服这种脑子灵光转得快的人

夜深爱杂谈
2026-09-09 20:42:11
1.49亿债务曝光!古天乐发文,向华强说他快睡天桥,只是冰山一角

1.49亿债务曝光!古天乐发文,向华强说他快睡天桥,只是冰山一角

精彩一网打尽
2026-09-15 12:09:08
伯恩茅斯成英超黑店,为3名球员标价3亿英镑,阿森纳冬窗有意身价1亿英镑20岁前锋

伯恩茅斯成英超黑店,为3名球员标价3亿英镑,阿森纳冬窗有意身价1亿英镑20岁前锋

福酱的小时光
2026-09-18 09:39:13
钱再多有什么用?敬一丹走后,73岁丈夫的处境给所有夫妻敲响警钟

钱再多有什么用?敬一丹走后,73岁丈夫的处境给所有夫妻敲响警钟

旧史新谭
2026-09-15 20:04:52
小鹏G9L正式上市:定位中大型五座SUV,限时售价23.18万元起

小鹏G9L正式上市:定位中大型五座SUV,限时售价23.18万元起

答答买车
2026-09-18 13:08:10
美剧神作排行榜

美剧神作排行榜

喜欢历史的阿繁
2026-09-11 00:50:02
陈妤颉:希望百米靠近11秒05,目标保三项,争一项

陈妤颉:希望百米靠近11秒05,目标保三项,争一项

懂球帝
2026-09-18 09:38:08
坏消息,还是来了

坏消息,还是来了

隔壁老投
2026-09-17 14:38:03
普安县司法局奇葩通知:律师辩护意见改变黑恶罪名定性,需报司法局研究同意才能发表

普安县司法局奇葩通知:律师辩护意见改变黑恶罪名定性,需报司法局研究同意才能发表

追月数星
2026-09-18 13:15:46
2026-09-18 14:24:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14017文章数 142733关注度
往期回顾 全部

科技要闻

苹果店外黄牛蹲守:18 Pro Max加价500

头条要闻

折叠iPhone还没开售 维修费引热议:换块屏或8000元

头条要闻

折叠iPhone还没开售 维修费引热议:换块屏或8000元

体育要闻

一个角色球员,靠什么在NBA征战17年

娱乐要闻

敬一丹逝世 央视送别,女儿成“心病”

财经要闻

中国汽车:尾大不掉,必须出清

汽车要闻

纯电/插混双动力+五座/六座双布局 海狮08应该怎么选?

态度原创

健康
家居
教育
艺术
时尚

剧烈头痛伴呕吐,警惕脑动脉瘤破裂

家居要闻

2026建博会(广州) 公装联探展交流活动

教育要闻

英国文化教育协会发布BC雅思官方模考系统

艺术要闻

韦启美 81岁时画的这幅瓶花,28.75万!

没想到这件事,对我的改变这么大!

无障碍浏览 进入关怀版