网易首页 > 网易号 > 正文 申请入驻

用3D几何先验驱动视频扩散,实现更一致的世界生成

0
分享至



随着视频扩散模型能力不断提升,从单张图像出发、按照用户指定的相机轨迹生成新视角视频,正在成为 World Modeling 的重要技术路线。

Camera-Controlled Video Diffusion Models 已经能够利用相机参数或几何条件控制视角变化,并生成具有较高视觉质量的视频。然而,这类方法大多依赖隐式的时空表示,缺少显式的 3D geometric grounding。尤其在较大的视角变化下,模型容易出现不合理的几何结构、物体形变以及跨视角空间不一致等问题。

针对这一问题,智象未来 (HiDream.ai) 提出 DreamWorld: Geometry-Grounded Video Diffusion for 3D-Consistent World Modeling,并被 ECCV 2026 录用。

DreamWorld 的核心思路是:将 3D Foundation Model 的空间结构先验与 Video Diffusion Model 的高质量生成能力结合起来,并显式地把 Geometry 作为世界生成过程中的中间结构表示。

不同于直接在 RGB 空间中完成所有生成任务,DreamWorld 采用 Geometry-then-Appearance 的两阶段框架:

先生成目标视角对应的几何结构特征,再以这些特征为条件生成最终 RGB 视频。



图 1: DreamWorld 与现有 Camera-Controlled Video Diffusion Models 的概念对比。与缺少显式 3D geometric grounding 的方法不同,DreamWorld 将 geometry 作为中间结构表示,引入 3D Foundation Model 的空间结构先验,以提升跨视角一致性与几何稳定性。



  • 论文标题:DreamWorld: Geometry-Grounded Video Diffusion for 3D-Consistent World Modeling
  • 论文主页:https://yanghb22-fdu.github.io/DreamWorld
  • 论文链接:https://yanghb22-fdu.github.io/DreamWorld/asserts/DreamWorld.pdf

本文核心亮点

几何驱动:将 3D Foundation Model 的空间结构先验引入 Video Diffusion,为 Camera-Controlled World Generation 提供显式的 3D geometric grounding。

结构中间态:将 Geometry 从视频生成中的隐式结果提升为显式的 intermediate structural pivot,先生成目标视角的几何结构表示,再指导最终视频合成。

生成解耦:采用 Geometry-then-Appearance 两阶段框架,将 3D 结构推理与高质量外观生成分开建模,兼顾几何一致性与视觉质量。

效果领先:DreamWorld 在 RealEstate10K、Tanks-and-Temples 和 WorldScore 等基准上取得领先表现。

01 Camera-Controlled Video Generation,

还缺什么?

近年来,视频扩散模型不断扩展生成模型的能力边界。在 Camera-Controlled Video Generation 中,用户可以给定一张初始场景图像,并指定一条相机轨迹,模型再根据相机运动生成对应的新视角视频。这类方法使视频生成模型逐渐具备了 “探索场景” 的能力,也成为 World Modeling 的重要技术路线之一。但问题在于:生成的视频看起来真实,并不意味着背后的 3D 空间一定稳定。

现有方法通常利用相机参数、Plücker embedding,或者由单张图像重建得到的点云投影视图作为生成条件。这些方法已经可以实现较好的 camera control,但视频扩散模型本身仍然主要依赖隐式的时空表征来推断未观测区域的场景结构。

在较大的 viewpoint change 下,这种缺乏显式 3D grounding 的建模方式可能带来:

  • geometrically implausible structures;
  • distorted object shapes;
  • cross-view spatial inconsistencies。

也就是说,在相机不断移动的过程中,模型不仅需要生成新的图像内容,还要持续推断原本不可见的三维结构。而这正是当前 Camera-Controlled VDM 面临的重要挑战。

02 从视频生成,

到 Geometry-Grounded Video Diffusion

DreamWorld 的出发点,是重新思考 Geometry 在 Video Diffusion 中扮演的角色。

在很多已有方法中,Geometry 更像是一个辅助信息:相机参数可以告诉模型 “相机怎么移动”,几何投影可以提供目标视角下的部分可见内容,但最终的结构补全与视觉生成仍然需要由同一个视频模型共同完成。

DreamWorld 则选择了一条不同的路径:不再把 Geometry 只作为辅助条件,而是将其显式建模为生成过程中的 intermediate structural pivot。

换句话说,DreamWorld 不直接从输入图像一步生成最终目标视频,而是将生成过程拆分为两个连续阶段:给定 Input Image 和 Camera Trajectory,模型首先进行 Geometry Generation,生成目标视角对应的结构表示;随后,Appearance Generation 以这些 geometry features 为条件,进一步合成最终的 RGB Video。

第一阶段负责生成目标视角对应的结构表示。第二阶段再基于这些结构表示完成最终的视觉合成。这样,Geometry 不再只是 RGB 生成的隐式副产品,而成为连接 3D 空间结构和高质量视频生成的中间桥梁。



图 2: 直接以 warped partial images 作为条件时,生成结果容易受到结构缺失和投影 artifact 的影响;DreamWorld 则先在 geometry feature space 中完成结构推理,再进行 appearance synthesis,从而获得更加稳定的跨视角结果。

03 用 3D Foundation Model 提供结构先验

如果要显式建模 Geometry,一个自然的问题是:什么样的表示适合作为视频生成中的几何结构?

DreamWorld 选择预训练 3D Foundation Model 的中间特征作为 geometry representation。相比直接在 RGB pixel space 中进行结构推理,这类特征由大规模 3D /multi-view 数据预训练得到,能够编码与场景空间结构相关的 geometry-aware information。

具体而言,DreamWorld 从 3D Foundation Model 中提取多尺度几何特征,并通过一个轻量级的投影模块将其压缩到适合 Video Diffusion Model 使用的表示空间。随后,这些 geometry features 被作为显式结构条件,用于指导后续的视频生成。

因此,DreamWorld 的关键并不是直接预测某一种显式几何结果,而是将 3D Foundation Model 学到的空间结构先验转化为 Video Diffusion Model 可以利用的中间结构表示,从而连接 3D geometry modeling 与高质量视频生成。

04 Appearance Video Diffusion:

让生成建立在几何结构之上

DreamWorld 首先训练一个 Appearance Video Diffusion Model。它的目标并不是独立完成全部场景推理,而是在已经给定 geometry-aware representation 的前提下,生成高质量 RGB 视频。

具体来说,输入视频首先通过预训练 VAE Encoder 得到 latent representation。与此同时,视频会被输入预训练 3D Foundation Model,提取 multi-scale geometric features。但 3D Foundation Model 的 feature space 与 Video Diffusion Model 的 latent space 并不天然一致。

因此,DreamWorld 引入一个轻量级的 MLP-based compression module,将高维 geometry features 映射成更适合 Video Diffusion Model 使用的表示。随后,这些 geometry features 与 noisy video latent 在 channel dimension 上进行拼接,并共同输入 Appearance Video Diffusion Model。

这样,Appearance Model 的任务变得更加明确:在给定结构条件的情况下,专注于生成高质量的视觉内容。

而不是同时承担结构推理和外观生成两个目标。



图 5: DreamWorld 采用 Geometry-then-Appearance 的两阶段生成方式:首先根据输入图像和目标相机轨迹生成目标视角对应的 geometry representations,再将其作为结构条件输入 Appearance Video Diffusion Model,最终生成 RGB 视频。

05 Geometry Video Diffusion:

生成目标视角的结构表示

训练阶段可以从真实视频中提取完整的 geometry features。但在真实推理时,输入只有:一张初始图像;一条用户指定的相机轨迹。因此,一个关键问题是:目标新视角的 geometry features 从哪里来?

DreamWorld 为此进一步设计了 Geometry Video Diffusion Model。首先,模型根据输入图像构建初始场景的点云表示,并按照目标 camera trajectory 将其投影到新的视角。由于输入只有单张图像,这些 warped observations 天然是不完整的:新的视角会暴露原本不可见的区域,同时还会出现遮挡和结构缺失。

DreamWorld 将这些 incomplete warped observations 输入 3D Foundation Model,得到对应的 incomplete geometry features。

随后,Geometry Video Diffusion Model 在 geometry feature space 中进行条件生成:具体而言,Geometry Video Diffusion Model 以 incomplete geometry features 作为条件,在 geometry feature space 中进行条件生成,并预测目标视角对应的 complete geometry features。

训练时,真实目标视频提取出的 geometry features 作为学习目标。通过 feature-level flow matching,Geometry Video Diffusion Model 学习从不完整的结构条件中恢复目标新视角对应的完整 geometry representations。

因此,DreamWorld 并不是直接在 RGB 空间中完成所有缺失区域的补全,而是:先在 Geometry Space 中完成结构生成,再进入 Appearance Space 完成视觉生成。

06 Geometry-then-Appearance:

把两个任务拆开

DreamWorld 的整体推理过程最终形成了一个清晰的两阶段 pipeline。

第一阶段:Geometry Video Diffusion Model: 输入初始 observation 和目标 camera trajectory,生成目标视角对应的 geometry representations。

第二阶段:Appearance Video Diffusion Model: 以第一阶段生成的 geometry representations 作为结构条件,在 VAE latent space 中进行条件去噪,并最终解码为 RGB frames。

因此,整个过程可以概括为:在完整推理过程中,DreamWorld 首先根据 initial observation 和 camera trajectory 进行 point-cloud-based warping,并利用 3D Foundation Model 从这些不完整观测中提取 geometry features。

随后,Geometry Video Diffusion Model 对这些结构特征进行生成式补全,得到目标视角对应的完整 geometry representations;最后,Appearance Video Diffusion Model 以这些结构表示作为条件,生成高质量的 novel-view RGB frames。

这个设计的核心是 Geometry-Appearance Decoupling。

Geometry Stage 主要关注:structural completion;cross-view consistency;camera adherence。

Appearance Stage 则主要关注:texture;visual details;photorealistic rendering。

通过这种 Geometry-then-Appearance 的方式,DreamWorld 将两个不同目标分开建模,使每个阶段可以更加专注于自己的任务。

07 定量比较:在多项基准上取得领先表现

DreamWorld 在 RealEstate10K、Tanks-and-Temples 以及 WorldScore 上进行了系统评测。

在 Novel View Synthesis 任务上,DreamWorld 在 RealEstate10K 和 Tanks-and-Temples 的 Easy / Hard Set 上均取得领先结果。



表 1: DreamWorld 在 RealEstate10K 和 Tanks-and-Temples 上的 Novel View Synthesis 定量比较结果。*

除了传统的 NVS 指标,我们进一步在 WorldScore 上评估模型的世界生成能力。DreamWorld 获得 75.04 的 Average Score,并在 3D Consistency 和 Photo Consistency 等指标上取得更佳表现。



表 2: DreamWorld 在 WorldScore photorealistic subset 上的定量比较结果。

08 定性结果:复杂新视角下保持更稳定的结构

定性结果进一步展示了不同方法在大视角变化下的表现差异。

现有方法在 novel viewpoints 下可能出现结构缺失、warping artifacts 或局部几何不一致。相比之下,DreamWorld 通过先生成 geometry representations、再进行 appearance synthesis,在复杂场景和较大视角变化下能够保持更加稳定的空间结构和视觉细节。



图 4: DreamWorld 与现有 Camera-Controlled World Generation 方法的定性比较。DreamWorld 在复杂新视角下表现出更好的结构一致性和视觉质量。



视频链接:https://mp.weixin.qq.com/s/ILJit4KpevGLR3CXFY_JOg

09 消融实验

我们进一步通过消融实验验证 DreamWorld 中两个核心设计:Geometry Diffusion 和 Geometry-Appearance Decoupling。

其中,Baseline 直接将 warped partial images 编码到 VAE latent space 作为条件进行视频生成,不引入显式的几何建模;w/o Geometry Diffusion 将条件替换为 3D Foundation Model 提取的 geometry features,但直接使用不完整的几何特征,不进行生成式结构补全;w/o Geo-App Decoupled 则进一步引入显式 geometry modeling,但将 geometry 与 appearance 放在同一个生成目标中联合建模。

相比这些变体,完整的 DreamWorld 同时采用 Geometry Diffusion 对缺失结构进行补全,并通过 Geometry-then-Appearance 的两阶段设计将结构推理与视觉生成解耦,取得了最优表现。



表 3: DreamWorld 核心模块的消融实验。验证了 Geometry Diffusion 与 Geometry-Appearance Decoupling 的有效性。

10 总结

DreamWorld 从 3D consistency 的角度重新思考 Camera-Controlled Video Generation:与其让 Video Diffusion Model 隐式完成所有空间推理,不如显式引入来自 3D Foundation Model 的结构先验,并将 Geometry 作为连接结构建模与视觉生成的中间表示。

通过 Geometry-then-Appearance 的两阶段框架,DreamWorld 先生成目标视角对应的 geometry representations,再基于这些结构特征完成最终的视频生成,从而在视觉质量、3D 一致性和相机控制之间取得更好的平衡。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
婚宴14道主菜上错7道,新郎父亲:亲友说酒席办得太差,很没有面子;酒店回应

婚宴14道主菜上错7道,新郎父亲:亲友说酒席办得太差,很没有面子;酒店回应

封面新闻
2026-10-06 21:20:26
男性衰老的标志:1臭、2大、3小,如果你没有,说明还年轻!

男性衰老的标志:1臭、2大、3小,如果你没有,说明还年轻!

医学科普汇
2026-08-04 20:10:07
刚说"我准备好了"就分手,他删光4年动态只留跑步记录

刚说"我准备好了"就分手,他删光4年动态只留跑步记录

时光慢旅人
2026-10-06 22:48:00
记录报:热苏斯承认曾对C罗撒谎,葡足协本能完全避免事件爆发

记录报:热苏斯承认曾对C罗撒谎,葡足协本能完全避免事件爆发

懂球帝
2026-10-07 13:23:10
套现146亿后跑路新加坡就能万事大吉?国家新规重拳出击:只要钱还在中国赚,拿了绿卡也照样得补税!申通前老板如意算盘,这下彻底落空了

套现146亿后跑路新加坡就能万事大吉?国家新规重拳出击:只要钱还在中国赚,拿了绿卡也照样得补税!申通前老板如意算盘,这下彻底落空了

人生录
2026-08-16 00:05:13
广东篮球圈炸了!13岁“小周琦”刷屏,臂展超周琦、比姚明长5CM

广东篮球圈炸了!13岁“小周琦”刷屏,臂展超周琦、比姚明长5CM

老沮系戏精北鼻
2026-10-07 10:37:35
王伟忠没想到,蔡康永风波闹大后,他一句评价被翻出,竟成神预言

王伟忠没想到,蔡康永风波闹大后,他一句评价被翻出,竟成神预言

嘴角上翘的弧度
2026-10-06 19:05:21
科莫主席:法布雷加斯想走就放行,无需补偿

科莫主席:法布雷加斯想走就放行,无需补偿

懂球帝
2026-10-06 17:53:34
东航欧某某多张高清照流出!长相神似孙小果,空姐被吓跪那一幕,一看就是狠角色

东航欧某某多张高清照流出!长相神似孙小果,空姐被吓跪那一幕,一看就是狠角色

秋风妃
2026-10-07 08:01:51
高芙为盘外招付出代价?首次不敌梅尔滕斯,止步中网女单16强

高芙为盘外招付出代价?首次不敌梅尔滕斯,止步中网女单16强

花魄m
2026-10-07 17:13:30
中国大满贯男单16强出炉,国乒仅剩2人,球迷必须承认4个事实

中国大满贯男单16强出炉,国乒仅剩2人,球迷必须承认4个事实

南海浪花
2026-10-07 16:07:54
河北男子与女同事开房兴奋过度,脑出血成植物人,家属竟向公司索赔38万!

河北男子与女同事开房兴奋过度,脑出血成植物人,家属竟向公司索赔38万!

天气观察站
2026-09-22 21:09:56
“台湾回归第一股”——订单暴增429%,排到明年,北向资金重仓锁死,节后爆发?

“台湾回归第一股”——订单暴增429%,排到明年,北向资金重仓锁死,节后爆发?

财报翻译官
2026-10-07 12:57:57
5岁男孩腋下包块一个月疯长,疼到手臂不敢放下!多家医院无解,直到妈妈随口说了一句话

5岁男孩腋下包块一个月疯长,疼到手臂不敢放下!多家医院无解,直到妈妈随口说了一句话

新民晚报
2026-09-28 09:47:28
2026年上半年消费降级有多狠?数据不会骗人

2026年上半年消费降级有多狠?数据不会骗人

职场资深秘书
2026-10-07 09:43:15
难说再见!梅西带3个儿子出场:当众落泪 48岁主帅也哭了 对手致敬

难说再见!梅西带3个儿子出场:当众落泪 48岁主帅也哭了 对手致敬

风过乡
2026-10-07 07:41:18
美国为何禁止种植竹子?终于明白,原来竹子比我们想象的更可怕

美国为何禁止种植竹子?终于明白,原来竹子比我们想象的更可怕

抽象派大师
2026-09-28 16:03:48
又一品牌“切割”:对于蔡康永不当行为强烈震惊、坚决反对,下架全部内容,保留追究责任权利

又一品牌“切割”:对于蔡康永不当行为强烈震惊、坚决反对,下架全部内容,保留追究责任权利

大风新闻
2026-10-06 15:47:16
家里有“这7样”东西要当心,看着不起眼,但是危害一点都不小

家里有“这7样”东西要当心,看着不起眼,但是危害一点都不小

抠搜侠
2026-10-07 14:23:58
央视曝光抓捕全貌,中方毫不留情:佤邦副总司令照抓,鲍军峰落网

央视曝光抓捕全貌,中方毫不留情:佤邦副总司令照抓,鲍军峰落网

爱下厨的阿酾
2026-10-07 15:20:36
2026-10-07 17:56:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14142文章数 142744关注度
往期回顾 全部

科技要闻

万亿砸向高速充电桩,排队为何仍是无解?

头条要闻

演员王星被骗至妙瓦底4天遭转卖3次 向女友发求救暗号

头条要闻

演员王星被骗至妙瓦底4天遭转卖3次 向女友发求救暗号

体育要闻

从骑马舞到开口全中文 德约在北京不止七冠

娱乐要闻

吴奇隆举旗活动取消,不赚钱也守立场

财经要闻

谷歌签下科技史上最大核能协议

汽车要闻

智能化再提升 2027款东风标致、东风雪铁龙新车更人性化了

态度原创

本地
教育
游戏
数码
军事航空

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

教育要闻

这么晚还没有做出来,都怕妈妈生气了

乐高首款《蝙蝠侠:阿卡姆骑士》主题套装公布:317片蝙蝠车,2027年1月发售

数码要闻

赛睿、KontrolFreek发布《堡垒之夜》联名游戏外设,覆盖广泛类别

军事要闻

外舰跟监遵义舰 结果自己先"趴窝"了

无障碍浏览 进入关怀版