网易首页 > 网易号 > 正文 申请入驻

用3D几何先验驱动视频扩散,实现更一致的世界生成

0
分享至



随着视频扩散模型能力不断提升,从单张图像出发、按照用户指定的相机轨迹生成新视角视频,正在成为 World Modeling 的重要技术路线。

Camera-Controlled Video Diffusion Models 已经能够利用相机参数或几何条件控制视角变化,并生成具有较高视觉质量的视频。然而,这类方法大多依赖隐式的时空表示,缺少显式的 3D geometric grounding。尤其在较大的视角变化下,模型容易出现不合理的几何结构、物体形变以及跨视角空间不一致等问题。

针对这一问题,智象未来 (HiDream.ai) 提出 DreamWorld: Geometry-Grounded Video Diffusion for 3D-Consistent World Modeling,并被 ECCV 2026 录用。

DreamWorld 的核心思路是:将 3D Foundation Model 的空间结构先验与 Video Diffusion Model 的高质量生成能力结合起来,并显式地把 Geometry 作为世界生成过程中的中间结构表示。

不同于直接在 RGB 空间中完成所有生成任务,DreamWorld 采用 Geometry-then-Appearance 的两阶段框架:

先生成目标视角对应的几何结构特征,再以这些特征为条件生成最终 RGB 视频。



图 1: DreamWorld 与现有 Camera-Controlled Video Diffusion Models 的概念对比。与缺少显式 3D geometric grounding 的方法不同,DreamWorld 将 geometry 作为中间结构表示,引入 3D Foundation Model 的空间结构先验,以提升跨视角一致性与几何稳定性。



  • 论文标题:DreamWorld: Geometry-Grounded Video Diffusion for 3D-Consistent World Modeling
  • 论文主页:https://yanghb22-fdu.github.io/DreamWorld
  • 论文链接:https://yanghb22-fdu.github.io/DreamWorld/asserts/DreamWorld.pdf

本文核心亮点

几何驱动:将 3D Foundation Model 的空间结构先验引入 Video Diffusion,为 Camera-Controlled World Generation 提供显式的 3D geometric grounding。

结构中间态:将 Geometry 从视频生成中的隐式结果提升为显式的 intermediate structural pivot,先生成目标视角的几何结构表示,再指导最终视频合成。

生成解耦:采用 Geometry-then-Appearance 两阶段框架,将 3D 结构推理与高质量外观生成分开建模,兼顾几何一致性与视觉质量。

效果领先:DreamWorld 在 RealEstate10K、Tanks-and-Temples 和 WorldScore 等基准上取得领先表现。

01 Camera-Controlled Video Generation,

还缺什么?

近年来,视频扩散模型不断扩展生成模型的能力边界。在 Camera-Controlled Video Generation 中,用户可以给定一张初始场景图像,并指定一条相机轨迹,模型再根据相机运动生成对应的新视角视频。这类方法使视频生成模型逐渐具备了 “探索场景” 的能力,也成为 World Modeling 的重要技术路线之一。但问题在于:生成的视频看起来真实,并不意味着背后的 3D 空间一定稳定。

现有方法通常利用相机参数、Plücker embedding,或者由单张图像重建得到的点云投影视图作为生成条件。这些方法已经可以实现较好的 camera control,但视频扩散模型本身仍然主要依赖隐式的时空表征来推断未观测区域的场景结构。

在较大的 viewpoint change 下,这种缺乏显式 3D grounding 的建模方式可能带来:

  • geometrically implausible structures;
  • distorted object shapes;
  • cross-view spatial inconsistencies。

也就是说,在相机不断移动的过程中,模型不仅需要生成新的图像内容,还要持续推断原本不可见的三维结构。而这正是当前 Camera-Controlled VDM 面临的重要挑战。

02 从视频生成,

到 Geometry-Grounded Video Diffusion

DreamWorld 的出发点,是重新思考 Geometry 在 Video Diffusion 中扮演的角色。

在很多已有方法中,Geometry 更像是一个辅助信息:相机参数可以告诉模型 “相机怎么移动”,几何投影可以提供目标视角下的部分可见内容,但最终的结构补全与视觉生成仍然需要由同一个视频模型共同完成。

DreamWorld 则选择了一条不同的路径:不再把 Geometry 只作为辅助条件,而是将其显式建模为生成过程中的 intermediate structural pivot。

换句话说,DreamWorld 不直接从输入图像一步生成最终目标视频,而是将生成过程拆分为两个连续阶段:给定 Input Image 和 Camera Trajectory,模型首先进行 Geometry Generation,生成目标视角对应的结构表示;随后,Appearance Generation 以这些 geometry features 为条件,进一步合成最终的 RGB Video。

第一阶段负责生成目标视角对应的结构表示。第二阶段再基于这些结构表示完成最终的视觉合成。这样,Geometry 不再只是 RGB 生成的隐式副产品,而成为连接 3D 空间结构和高质量视频生成的中间桥梁。



图 2: 直接以 warped partial images 作为条件时,生成结果容易受到结构缺失和投影 artifact 的影响;DreamWorld 则先在 geometry feature space 中完成结构推理,再进行 appearance synthesis,从而获得更加稳定的跨视角结果。

03 用 3D Foundation Model 提供结构先验

如果要显式建模 Geometry,一个自然的问题是:什么样的表示适合作为视频生成中的几何结构?

DreamWorld 选择预训练 3D Foundation Model 的中间特征作为 geometry representation。相比直接在 RGB pixel space 中进行结构推理,这类特征由大规模 3D /multi-view 数据预训练得到,能够编码与场景空间结构相关的 geometry-aware information。

具体而言,DreamWorld 从 3D Foundation Model 中提取多尺度几何特征,并通过一个轻量级的投影模块将其压缩到适合 Video Diffusion Model 使用的表示空间。随后,这些 geometry features 被作为显式结构条件,用于指导后续的视频生成。

因此,DreamWorld 的关键并不是直接预测某一种显式几何结果,而是将 3D Foundation Model 学到的空间结构先验转化为 Video Diffusion Model 可以利用的中间结构表示,从而连接 3D geometry modeling 与高质量视频生成。

04 Appearance Video Diffusion:

让生成建立在几何结构之上

DreamWorld 首先训练一个 Appearance Video Diffusion Model。它的目标并不是独立完成全部场景推理,而是在已经给定 geometry-aware representation 的前提下,生成高质量 RGB 视频。

具体来说,输入视频首先通过预训练 VAE Encoder 得到 latent representation。与此同时,视频会被输入预训练 3D Foundation Model,提取 multi-scale geometric features。但 3D Foundation Model 的 feature space 与 Video Diffusion Model 的 latent space 并不天然一致。

因此,DreamWorld 引入一个轻量级的 MLP-based compression module,将高维 geometry features 映射成更适合 Video Diffusion Model 使用的表示。随后,这些 geometry features 与 noisy video latent 在 channel dimension 上进行拼接,并共同输入 Appearance Video Diffusion Model。

这样,Appearance Model 的任务变得更加明确:在给定结构条件的情况下,专注于生成高质量的视觉内容。

而不是同时承担结构推理和外观生成两个目标。



图 5: DreamWorld 采用 Geometry-then-Appearance 的两阶段生成方式:首先根据输入图像和目标相机轨迹生成目标视角对应的 geometry representations,再将其作为结构条件输入 Appearance Video Diffusion Model,最终生成 RGB 视频。

05 Geometry Video Diffusion:

生成目标视角的结构表示

训练阶段可以从真实视频中提取完整的 geometry features。但在真实推理时,输入只有:一张初始图像;一条用户指定的相机轨迹。因此,一个关键问题是:目标新视角的 geometry features 从哪里来?

DreamWorld 为此进一步设计了 Geometry Video Diffusion Model。首先,模型根据输入图像构建初始场景的点云表示,并按照目标 camera trajectory 将其投影到新的视角。由于输入只有单张图像,这些 warped observations 天然是不完整的:新的视角会暴露原本不可见的区域,同时还会出现遮挡和结构缺失。

DreamWorld 将这些 incomplete warped observations 输入 3D Foundation Model,得到对应的 incomplete geometry features。

随后,Geometry Video Diffusion Model 在 geometry feature space 中进行条件生成:具体而言,Geometry Video Diffusion Model 以 incomplete geometry features 作为条件,在 geometry feature space 中进行条件生成,并预测目标视角对应的 complete geometry features。

训练时,真实目标视频提取出的 geometry features 作为学习目标。通过 feature-level flow matching,Geometry Video Diffusion Model 学习从不完整的结构条件中恢复目标新视角对应的完整 geometry representations。

因此,DreamWorld 并不是直接在 RGB 空间中完成所有缺失区域的补全,而是:先在 Geometry Space 中完成结构生成,再进入 Appearance Space 完成视觉生成。

06 Geometry-then-Appearance:

把两个任务拆开

DreamWorld 的整体推理过程最终形成了一个清晰的两阶段 pipeline。

第一阶段:Geometry Video Diffusion Model: 输入初始 observation 和目标 camera trajectory,生成目标视角对应的 geometry representations。

第二阶段:Appearance Video Diffusion Model: 以第一阶段生成的 geometry representations 作为结构条件,在 VAE latent space 中进行条件去噪,并最终解码为 RGB frames。

因此,整个过程可以概括为:在完整推理过程中,DreamWorld 首先根据 initial observation 和 camera trajectory 进行 point-cloud-based warping,并利用 3D Foundation Model 从这些不完整观测中提取 geometry features。

随后,Geometry Video Diffusion Model 对这些结构特征进行生成式补全,得到目标视角对应的完整 geometry representations;最后,Appearance Video Diffusion Model 以这些结构表示作为条件,生成高质量的 novel-view RGB frames。

这个设计的核心是 Geometry-Appearance Decoupling。

Geometry Stage 主要关注:structural completion;cross-view consistency;camera adherence。

Appearance Stage 则主要关注:texture;visual details;photorealistic rendering。

通过这种 Geometry-then-Appearance 的方式,DreamWorld 将两个不同目标分开建模,使每个阶段可以更加专注于自己的任务。

07 定量比较:在多项基准上取得领先表现

DreamWorld 在 RealEstate10K、Tanks-and-Temples 以及 WorldScore 上进行了系统评测。

在 Novel View Synthesis 任务上,DreamWorld 在 RealEstate10K 和 Tanks-and-Temples 的 Easy / Hard Set 上均取得领先结果。



表 1: DreamWorld 在 RealEstate10K 和 Tanks-and-Temples 上的 Novel View Synthesis 定量比较结果。*

除了传统的 NVS 指标,我们进一步在 WorldScore 上评估模型的世界生成能力。DreamWorld 获得 75.04 的 Average Score,并在 3D Consistency 和 Photo Consistency 等指标上取得更佳表现。



表 2: DreamWorld 在 WorldScore photorealistic subset 上的定量比较结果。

08 定性结果:复杂新视角下保持更稳定的结构

定性结果进一步展示了不同方法在大视角变化下的表现差异。

现有方法在 novel viewpoints 下可能出现结构缺失、warping artifacts 或局部几何不一致。相比之下,DreamWorld 通过先生成 geometry representations、再进行 appearance synthesis,在复杂场景和较大视角变化下能够保持更加稳定的空间结构和视觉细节。



图 4: DreamWorld 与现有 Camera-Controlled World Generation 方法的定性比较。DreamWorld 在复杂新视角下表现出更好的结构一致性和视觉质量。



视频链接:https://mp.weixin.qq.com/s/ILJit4KpevGLR3CXFY_JOg

09 消融实验

我们进一步通过消融实验验证 DreamWorld 中两个核心设计:Geometry Diffusion 和 Geometry-Appearance Decoupling。

其中,Baseline 直接将 warped partial images 编码到 VAE latent space 作为条件进行视频生成,不引入显式的几何建模;w/o Geometry Diffusion 将条件替换为 3D Foundation Model 提取的 geometry features,但直接使用不完整的几何特征,不进行生成式结构补全;w/o Geo-App Decoupled 则进一步引入显式 geometry modeling,但将 geometry 与 appearance 放在同一个生成目标中联合建模。

相比这些变体,完整的 DreamWorld 同时采用 Geometry Diffusion 对缺失结构进行补全,并通过 Geometry-then-Appearance 的两阶段设计将结构推理与视觉生成解耦,取得了最优表现。



表 3: DreamWorld 核心模块的消融实验。验证了 Geometry Diffusion 与 Geometry-Appearance Decoupling 的有效性。

10 总结

DreamWorld 从 3D consistency 的角度重新思考 Camera-Controlled Video Generation:与其让 Video Diffusion Model 隐式完成所有空间推理,不如显式引入来自 3D Foundation Model 的结构先验,并将 Geometry 作为连接结构建模与视觉生成的中间表示。

通过 Geometry-then-Appearance 的两阶段框架,DreamWorld 先生成目标视角对应的 geometry representations,再基于这些结构特征完成最终的视频生成,从而在视觉质量、3D 一致性和相机控制之间取得更好的平衡。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
中方定性,美国违反市场原则,大量黄金运抵中国,逼出头号接盘国

中方定性,美国违反市场原则,大量黄金运抵中国,逼出头号接盘国

影孖看世界
2026-08-21 15:03:32
四川升学宴事故后续,知情人曝主家已被警方带走,村支书发声被喷,刚考上本科的这个孩子可能没钱读大学了

四川升学宴事故后续,知情人曝主家已被警方带走,村支书发声被喷,刚考上本科的这个孩子可能没钱读大学了

老猫观点
2026-08-21 16:20:00
她是国家一级女演员,被传给丈夫戴绿帽,重病丈夫坐轮椅还不离婚

她是国家一级女演员,被传给丈夫戴绿帽,重病丈夫坐轮椅还不离婚

夏末moent
2026-08-22 00:05:43
东北出马仙那么“灵”,道教为啥不认?1800年前张天师划了条死线

东北出马仙那么“灵”,道教为啥不认?1800年前张天师划了条死线

历史教堂
2026-08-20 16:55:41
台风“沙德尔”周日或达超强台风级 最新路径→

台风“沙德尔”周日或达超强台风级 最新路径→

极目新闻
2026-08-21 19:07:26
日本传来不好信号!朝鲜专家曾警告:再得罪中国,高市恐无力回天

日本传来不好信号!朝鲜专家曾警告:再得罪中国,高市恐无力回天

呼呼历史论
2026-08-22 00:17:00
蒙古国网红侮辱中方员工,部长戳脑门骂,别忘了我们为什么乞求!

蒙古国网红侮辱中方员工,部长戳脑门骂,别忘了我们为什么乞求!

等风上青云
2026-08-20 13:26:21
大暴雨抵达福建!泉州、厦门发布暴雨红色预警

大暴雨抵达福建!泉州、厦门发布暴雨红色预警

看看新闻Knews
2026-08-21 20:19:27
“十五五”期间,四川将重点对建成满20年的住宅小区开展专项体检

“十五五”期间,四川将重点对建成满20年的住宅小区开展专项体检

封面新闻
2026-08-21 13:26:02
中俄没能最后一刻挽救伊朗,才知道伊朗为何没选歼10:有4点原因

中俄没能最后一刻挽救伊朗,才知道伊朗为何没选歼10:有4点原因

琴音缭绕回
2026-08-21 13:49:07
我妈出轨20年,我爸忍耐了20年,我妈50岁生日时我才知道他有多狠

我妈出轨20年,我爸忍耐了20年,我妈50岁生日时我才知道他有多狠

千秋文化
2026-08-12 20:13:55
宇树科技为何急着上市:是真缺钱还是怕泡沫破?

宇树科技为何急着上市:是真缺钱还是怕泡沫破?

小眼睛小世界
2026-08-21 04:23:02
46岁张柏芝冲浪,被晒黑却大笑:别人酸她作秀,我倒觉得她活明白了

46岁张柏芝冲浪,被晒黑却大笑:别人酸她作秀,我倒觉得她活明白了

陈意小可爱
2026-08-21 13:27:56
社保缴费基数低于70%就危险了!多地已亮黄灯,你的企业中招没?

社保缴费基数低于70%就危险了!多地已亮黄灯,你的企业中招没?

補懂事的孩紙
2026-08-22 00:55:48
百事营收是可口可乐近2倍,为什么多数人却觉得可口可乐更大?

百事营收是可口可乐近2倍,为什么多数人却觉得可口可乐更大?

混沌录
2026-08-19 22:51:06
两性关系:女人的心动荷尔蒙,不靠花言巧语,全看男人这些小细节

两性关系:女人的心动荷尔蒙,不靠花言巧语,全看男人这些小细节

小影的娱乐
2026-08-22 00:18:58
望京大熊猫“秃噜皮”了?街道出手了!

望京大熊猫“秃噜皮”了?街道出手了!

望京网
2026-08-21 16:55:54
好事将近?迪丽热巴陈飞宇被曝见家长,陈凯歌陈红态度成最大变数

好事将近?迪丽热巴陈飞宇被曝见家长,陈凯歌陈红态度成最大变数

兵鉴史
2026-08-21 02:52:39
特朗普不敢对中方做的事,美财长做了,马斯克:这下麻烦大了

特朗普不敢对中方做的事,美财长做了,马斯克:这下麻烦大了

风雨与阳光
2026-08-21 20:47:05
多地要求核查HPV疫苗接种,又在抽什么疯?

多地要求核查HPV疫苗接种,又在抽什么疯?

法度law
2026-08-20 17:37:23
2026-08-22 01:43:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13812文章数 142724关注度
往期回顾 全部

科技要闻

阿里AI的两面:云赚56亿,千问烧掉138亿

头条要闻

辽宁一处长在单位门口遭枪击 女儿被警察配枪护学近1年

头条要闻

辽宁一处长在单位门口遭枪击 女儿被警察配枪护学近1年

体育要闻

续哈登+招沃特森=骑士赌了

娱乐要闻

冯绍峰七夕带儿子游玩!次日聚会

财经要闻

蔡昉解读经济:扩大消费需求的政策思考

汽车要闻

长城炮Hi4-T生态车型发布 飞手版15.18万、黑武士版17.88万起

态度原创

数码
房产
健康
游戏
公开课

数码要闻

韶音发布首款AI耳机OpenFit 2:售1398元 联合千问大模型

房产要闻

两大热盘即将入市!三亚又一批安居房狠货要炸场了!

“矫正神器”真能治好脊柱侧弯吗?

被梗淹没,不知所措,试玩《奥星热浪》后我没绷住

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版