网易首页 > 网易号 > 正文 申请入驻

GaussianDWM:用3D高斯表示统一自动驾驶场景理解与多模态生成

0
分享至



自动驾驶世界模型的研究目标已经从单纯预测未来视觉帧,扩展到构建可用于场景理解、空间定位和后续决策的世界表示。如果模型只能生成外观上合理的未来图像,却无法回答场景中有哪些目标、目标位于何处,以及不同视角下的空间结构如何变化,那么它仍然缺少对三维驾驶环境的显式建模能力。

GaussianDWM 关注的正是这一问题:在统一的 3D 场景表示中同时支持理解任务和生成任务。



  • 作者:Tianchen Deng, Xuefeng Chen, Yi Chen, Qu Chen, Yuyao Xu, Lijin Yang, Le Xu, Yu Zhang, Bo Zhang, Wuxiong Huang, Hesheng Wang 机构:上海交通大学、清华大学、旷视科技、Mach Drive
  • 论文名称:GaussianDWM: 3D Gaussian Driving World Model for Unified Scene Understanding and Multi-Modal Generation
  • 开源地址:https://github.com/dtc111111/GaussianDWM

GaussianDWM 试图把这两件事放到同一个框架里:一边做驾驶场景理解,一边完成空间生成、时间生成和 RGB-D 生成。它的核心选择是把 3D Gaussian scene representation 放在世界模型中间,用同一种 3D 表示同时承载几何、外观和语言语义。



面向场景理解的自动驾驶世界模型

过去几年,Driving World Model 的讨论大多围绕生成能力展开。一个典型目标是:给定当前或历史观测,模型预测未来的驾驶场景,或者在车辆发生位姿变化时合成新的视角。这类能力对仿真、数据生成和闭环评测都很有价值,但它并没有覆盖自动驾驶系统真正需要面对的全部问题。

在真实驾驶场景里,模型还要能回答更加结构化的问题。例如,场景中是否存在某个被语言描述的目标?目标在图像或 3D 空间里的位置在哪里?当前驾驶环境能否支持后续规划?这些问题要求模型不仅能够从图像中提取视觉特征并生成结果,还需要把外观、几何结构和语义信息组织为一种可被语言模型读取和利用的场景表示。

这也是 GaussianDWM 的出发点。现有一些统一框架依赖 BEV 或 depth 特征做 feature-level alignment,但这种对齐更多发生在中间特征层,模型未必真正拥有一个统一的 3D 场景表征。GaussianDWM 选择以 3D Gaussians 作为场景的底座,希望让同一组表示既能进入 LLM 做理解,也能作为条件进入生成模块。

把 3D Gaussian 变成 LLM 能读懂的世界表示

GaussianDWM 的整体框架可以拆成三个部分:World Tokenizer、Scene Understanding 和 Multi-modal Generation。三个模块之间不是简单串联,而是围绕同一个 3D Gaussian 表示展开:先把多视角图像组织成带语言语义的高斯场,再把这些高斯压缩、采样并投影到 LLM 的 embedding space,最后用 LLM 提取出的 world knowledge 继续指导 RGB-D 生成。



第一步是 Language-enhanced 3D Gaussian Tokenizer。传统 3D Gaussian primitive 通常关注位置、不透明度、尺度、旋转等几何和外观属性。GaussianDWM 在此基础上加入语言特征,使每个 Gaussian primitive 不再只是一个可渲染的小单元,也成为一个携带语义信息的 3D token。

这些语言特征来自 CLIP,并继承 SAM 提供的层次语义。为了控制存储和计算开销,方法中还使用 scene-wise language autoencoder,将原本 512 维的 CLIP feature 压缩到 3 维。这样做的目的不是把语言信息变成一个孤立的附加项,而是让语义真正落在 3D 场景中的空间位置上。

不过,构建出高斯场只是第一步。LLM 并不能直接处理一个密集的 3D Gaussian 场,因此 GaussianDWM 引入 Gaussian Projector 和 task-aware sampling。Projector 负责把位置、opacity、scale、rotation 以及 language feature 映射到 LLM embedding space;sampling 则根据任务选择更合适的 Gaussian tokens。

在全局理解任务中,模型使用 uniform sampling 和 top-k sampling 保留场景整体信息;在 2D/3D visual grounding 中,采样会参考 text query 与 Gaussian feature 的 similarity,从稠密高斯中挑出更相关的部分。主实验中,模型从场景里采样 4096 个 Gaussian tokens 输入 LLM。这个数量本身也说明了一个现实取舍:3D 表示足够丰富,但必须先变得紧凑,语言模型才有可能稳定地使用它。

理解结果反过来参与生成

GaussianDWM 的另一个关键设计,是没有把理解和生成完全切开。生成模块采用 dual-condition generation,同时接收 low-level condition 和 high-level world knowledge。前者主要来自 sparse RGB/depth condition,负责约束纹理和几何;后者来自 LLM 提取出的 world knowledge,提供更高层的语义与空间先验。

这种设计与驾驶场景中的多层次约束相匹配。low-level condition 主要由 sparse RGB/depth 提供,用于约束局部纹理和几何结构,但对目标关系、空间布局和语义一致性的表达能力有限。high-level world knowledge 来自 LLM 的场景理解结果,能够为生成过程补充语义和空间先验。GaussianDWM 将二者结合,用 low-level condition 保持视觉细节和几何约束,用 high-level world knowledge 强化场景关系与语义一致性,从而服务空间生成、时间生成和 RGB-D 生成。

在 NuInteract 上,

3D Gaussian 带来更强的场景理解

为了验证场景理解能力,GaussianDWM 在 NuInteract 上进行了评估。相比只依赖传统视觉或语言特征的做法,3D Gaussian 给模型提供了更加明确的空间结构,也让视觉定位任务获得了明显收益。

从主表结果看,GaussianDWM 的平均指标达到 59.23,高于 DriveMonkey 的 52.12。在 2D visual grounding 上,mAP 从 19.47 提升到 34.95;在 3D visual grounding 上,mAP 从 34.53 提升到 52.78。这组结果比较直接地说明,高斯表示并不是只对渲染或生成有用,它也能帮助 LLM 更好地理解 3D 驾驶环境。



在 nuScenes 上,

统一表示也服务 RGB-D 空间生成

多模态生成部分则主要在 nuScenes 上验证。GaussianDWM 关注的不只是 RGB 图像,还包括 RGB-D generation,这使得结果需要同时面对外观质量和空间几何的一致性。

在空间生成任务中,当视角位移为 ±1m 时,GaussianDWM 的 FID/FVD 为 8.36/44.50;当视角位移为 ±2m 时,FID/FVD 为 11.27/68.17。与 PVG、StreetGaussian、DiST-S 等方法相比,GaussianDWM 在小到中等位移下取得了更低的 FID/FVD。对于自动驾驶场景来说,这类结果的意义在于:模型不是单纯做一张新图,而是在尽量维持场景 3D 关系的前提下完成视角变化。







消融实验:Gaussian、采样和

World Knowledge 都是支撑模型能力的关键部分

论文中的消融实验进一步解释了每个设计的作用。去掉 Gaussian 后,模型平均指标为 53.32;加入 Gaussian 并使用 similarity sampling 后,平均指标提升到 59.23。这个差距说明,3D Gaussian 在理解任务中提供的不是可有可无的额外信息,而是能够改变模型输入质量的核心表示。

在生成任务上,dual-condition 的作用也比较清楚。只使用 low-level condition 时,±1m 下的 FID 为 10.12;加入 high-level world knowledge 后,FID 降到 8.36。更大的视角变化下,world knowledge 的贡献更加明显:在 ±4m 条件下,FID 从 21.79 降到 18.91。换句话说,当低层视觉条件不足以覆盖更大空间变化时,高层语义和空间先验开始发挥更重要的作用。



视频展示:把生成能力放到动态场景中看



视频链接:https://mp.weixin.qq.com/s/osoYZr1dCwceHv-0s7ZIsg?click_id=125

Overall visual walkthrough



视频链接:https://mp.weixin.qq.com/s/osoYZr1dCwceHv-0s7ZIsg?click_id=125

Spatial generation



视频链接:https://mp.weixin.qq.com/s/osoYZr1dCwceHv-0s7ZIsg?click_id=125

Temporal generation



视频链接:https://mp.weixin.qq.com/s/osoYZr1dCwceHv-0s7ZIsg?click_id=125

Future prediction grid



Long-sequence prediction

结语:统一驾驶世界模型

需要可生成,也需要可查询

GaussianDWM 的核心观点可以概括为一句话:自动驾驶世界模型不应只追求生成未来画面,也需要形成一个能被理解、被查询、被用于定位和规划的 3D 世界表示。3D Gaussian 在这里扮演了连接器的角色,它把几何、外观和语言语义放到同一个场景表示中,再通过 task-aware sampling 和 Gaussian Projector 进入 LLM。

在这个框架下,LLM 不只是负责回答问题,也会提取 world knowledge feature,并把理解结果继续交给生成模块使用。NuInteract 和 nuScenes 上的结果表明,这种统一表示同时改善了场景理解和多模态生成。对于自动驾驶世界模型来说,这可能比单纯追求更清晰的视频更重要:模型最终要服务的是一个会移动、会交互、需要解释当前世界并预测未来世界的系统。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
“宁愿等19年,也要绕开中国!”9月16日,韩国一口气把中亚五国总统请到首尔

“宁愿等19年,也要绕开中国!”9月16日,韩国一口气把中亚五国总统请到首尔

扶苏聊历史
2026-09-18 15:18:08
浙江夜场整治事件舆论发酵!网传一女生从浙江回乡,先后相亲12个对象,听闻籍贯直接拒绝

浙江夜场整治事件舆论发酵!网传一女生从浙江回乡,先后相亲12个对象,听闻籍贯直接拒绝

火山詩话
2026-09-18 05:31:57
三名机长吃印度酒店早餐,飞行途中集体拉稀,飞机差点变无人驾驶

三名机长吃印度酒店早餐,飞行途中集体拉稀,飞机差点变无人驾驶

杭城村叔
2026-09-18 13:55:07
没想到,敬一丹葬礼仅1天,倪萍竟因一个举动被公然挑毛病

没想到,敬一丹葬礼仅1天,倪萍竟因一个举动被公然挑毛病

叶公子
2026-09-18 11:50:52
中央政法委正在公示!

中央政法委正在公示!

黄河新闻网吕梁
2026-09-18 11:04:13
月球上遍地是土,却没人敢随便挖一锹。为什么?因为那层4米厚的月壤,压根不是普通泥土,而是太阳系40亿年演化留下的“黑匣子”

月球上遍地是土,却没人敢随便挖一锹。为什么?因为那层4米厚的月壤,压根不是普通泥土,而是太阳系40亿年演化留下的“黑匣子”

扶苏聊历史
2026-09-18 15:26:02
陈冠希现开机仪式,长发齐肩胡子拉碴,跟大肚垮脸的黄秋生差别大

陈冠希现开机仪式,长发齐肩胡子拉碴,跟大肚垮脸的黄秋生差别大

娱说瑜悦
2026-09-17 19:06:50
连续两届无缘亚运决赛!中国男篮20分惨负日本 胡金秋16分

连续两届无缘亚运决赛!中国男篮20分惨负日本 胡金秋16分

醉卧浮生
2026-09-18 19:58:58
摸臀事件后续!滴滴司机发声,“摸臀姐”的报应来了……

摸臀事件后续!滴滴司机发声,“摸臀姐”的报应来了……

麦杰逊
2026-09-18 14:04:45
江浙沪“服装店老板娘”爆火!一张相亲截图炸出热议:相亲要查个税、做背调

江浙沪“服装店老板娘”爆火!一张相亲截图炸出热议:相亲要查个税、做背调

火山詩话
2026-09-18 06:43:50
10岁男孩溺亡两个月后,班主任被立案侦查

10岁男孩溺亡两个月后,班主任被立案侦查

中国新闻周刊
2026-09-18 21:37:24
郭士强再惹争议:不给自己打分 也不给球员打分 我们都很努力

郭士强再惹争议:不给自己打分 也不给球员打分 我们都很努力

醉卧浮生
2026-09-18 21:16:51
家属回应“女子生育后渐失明失聪”:患NF2罕见病,生育前已有症状 医生称极罕见、无普遍性

家属回应“女子生育后渐失明失聪”:患NF2罕见病,生育前已有症状 医生称极罕见、无普遍性

红星新闻
2026-09-18 17:08:22
广西“替人养子”事件冲上热搜:一个出轨女,害惨三代人……

广西“替人养子”事件冲上热搜:一个出轨女,害惨三代人……

桌子的生活观
2026-09-18 12:45:59
国乒最新战报!世界冠军被轰3-0,王艺迪三线冲冠,单打2胜5负!

国乒最新战报!世界冠军被轰3-0,王艺迪三线冲冠,单打2胜5负!

刘姚尧的文字城堡
2026-09-18 20:17:34
为了顺利邀请中方秋季访美,美国将拿出顶级规格迎接中国代表团。

为了顺利邀请中方秋季访美,美国将拿出顶级规格迎接中国代表团。

荆楚寰宇文枢
2026-09-18 23:19:04
拍出这张照片的人就是天才!网友:不得不佩服

拍出这张照片的人就是天才!网友:不得不佩服

摄影技巧入门教程
2026-09-18 16:18:32
秦王级别墓葬现世!墓主或为秦始皇嫡祖母

秦王级别墓葬现世!墓主或为秦始皇嫡祖母

91.6陕西交通广播
2026-09-18 20:56:20
杨某媛在西班牙读研被举报,“轻松熊”被发律师函

杨某媛在西班牙读研被举报,“轻松熊”被发律师函

历史总在押韵
2026-09-18 23:59:59
狂赚802亿,稳坐全球第三,晋江首富正在掏空全国中产家庭的钱包

狂赚802亿,稳坐全球第三,晋江首富正在掏空全国中产家庭的钱包

流苏晚晴
2026-09-18 14:16:09
2026-09-19 06:24:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14023文章数 142733关注度
往期回顾 全部

科技要闻

直击iPhone 18新机发售:黄牛加价不如前代

头条要闻

俄杜马选举拉夫罗夫"意外"登顶名单 梅德韦杰夫被拿下

头条要闻

俄杜马选举拉夫罗夫"意外"登顶名单 梅德韦杰夫被拿下

体育要闻

好吧,中国男篮辛苦了

娱乐要闻

陈思诚 佟丽娅不想让儿子知道两人离婚

财经要闻

研发0.25亿理财26亿,敷尔佳豪赌三类器械

汽车要闻

纯电/插混双动力+五座/六座双布局 海狮08应该怎么选?

态度原创

本地
时尚
数码
手机
公开课

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

直播|| 私藏几年的小众千元包,这5只越背越香!

数码要闻

2699元!磐镭WO5迷你主机上新:酷睿i5-13500H+16GB内存

手机要闻

实探苹果门店:iPhone 18 Pro Max黑色最早售罄

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版