![]()
机器人走出实验室后,训练数据不再只是 “多不多” 的问题:环境能否覆盖真实世界的尺度、遮挡、接触和运动,直接决定策略能否落地。Real2Sim 因此重新受到关注 —— 如果普通视频也能变成可交互的仿真场景,采集成本会比人工建模或专用设备低得多。
难点在于,视频里看见的世界并不等于物理引擎可用的世界。现有 4D 重建常以隐式场、Gaussian primitives 或点云为结果,适合新视角渲染,却很难直接拆出独立对象,也缺少封闭 Mesh、真实尺度和稳定的时序运动。
OVOW(One Video, One World)给出的答案很直接:从一段普通单目视频出发,把场景拆成实例,补全几何,恢复尺度与运动,再按照重力、接触和支撑关系重新组装,最终得到可以进入物理引擎的 4D Mesh 世界。该工作由清华大学、中国科学技术大学、SparcAI 等团队完成,已被 ECCV 2026 接收。
![]()
OVOW:从单目视频出发,恢复实例级 4D Mesh 世界,并将其送入物理仿真
![]()
- 论文标题:One Video, One World: Turning Monocular Video into Physical 4D Scenes
- 项目主页:https://onevideooneworld.github.io/
- 论文:https://arxiv.org/abs/2606.31388
- 代码:https://github.com/SparcAI-Inc/OVOW
从 “能渲染” 到 “能仿真”
OVOW 的突破不只是 “重建得像”,而是输出可编辑、可碰撞的实例级 Mesh:刚体记录真实尺度与逐帧 6-DoF 位姿,非刚体保留拓扑一致的时序形变。对象因此能被单独移动、删除或替换。
系统还会估计地面和重力,修正悬浮、穿透与错误支撑;单张图片也可作为一帧视频处理。
![]()
Image-to-3D Reconstruction:每组左侧为输入图像,右侧为 OVOW 恢复的实例级 3D Mesh 场景。系统能够在单图条件下恢复独立对象、完整几何与空间布局。图片来源:OVOW 论文 Figure 5 / 项目主页。
一条从视频到物理世界的流水线
整条流水线不另训专用大模型,而是串联视觉基础模型,依次完成场景理解、几何与运动恢复、物理组装。
![]()
OVOW 方法总览(阶段 1–3):从视频中的对象发现与运动分类出发,分别恢复静态/刚体 Mesh、可变形 Mesh 序列、真实尺度与逐帧运动
系统先识别实例与运动类型并生成跨帧掩码,再补全遮挡区域,恢复静态、刚体及可变形对象的 Mesh;随后估计真实尺度与逐帧运动,最后校正地面、重力、悬浮、穿透和支撑关系。
关键设计|不依赖预定义骨架或类别模板,直接用顶点形变统一描述静态、刚体与非刚性运动。
一套表示,覆盖静态、刚体与非刚性运动
OVOW 以实例 Mesh 为底座,将整体轨迹与局部形变分开,因而能同时处理车辆、飞机等刚体,以及飞鹰、北极熊等非刚体。
案例一|桌面刚体
![]()
动态 GIF:左侧为黑色越野车、哑铃与花盆组成的输入视频,右侧为 OVOW 恢复的实例级 4D Mesh 场景。画面来自 OVOW 项目主页官方演示
案例二|室内多对象
![]()
动态 GIF:左侧为黑色越野车、哑铃与花盆组成的输入视频,右侧为 OVOW 恢复的实例级 4D Mesh 场景。画面来自 OVOW 项目主页官方演示
案例三|飞鹰形变
![]()
动态 GIF:左侧为野外飞鹰视频,右侧为 OVOW 恢复的拓扑一致非刚性 4D Mesh。画面来自 OVOW 项目主页官方演示
案例四|机场多刚体
![]()
动态 GIF:左侧为机场多对象视频,右侧为 OVOW 恢复的实例级刚体 Mesh 场景。飞机、摆渡车与航站楼被分别重建。画面来自 OVOW 项目主页官方演示
案例五|北极熊形变
![]()
动态 GIF:左侧为包含北极熊及多个物体的视频,右侧为 OVOW 恢复的实例级 4D Mesh 场景。画面来自 OVOW 项目主页官方演示
从重建结果到物理仿真的最后一公里
可仿真的关键,是改变初始条件后,场景仍能产生新结果。
仿真与编辑
OVOW 可重新摆放对象或施加外力,由物理引擎计算新的碰撞、倾倒和位移。
案例一|原始布局
![]()
动态 GIF:OVOW 项目主页“Simulation and Editing”中的 Toy-Car Tabletop I。重建得到的黑色越野车、哑铃、花盆与桌面资产在新的初始状态下发生碰撞、倾倒与位移
案例二|改变布局
![]()
动态 GIF:Toy-Car Tabletop II。花盆位于车辆前方,哑铃与书本采用新的初始位置;在重力与接触作用下,各实例产生与案例一不同的碰撞和位移
案例三|重新组合
![]()
动态 GIF:Toy-Car Tabletop III。哑铃、花盆、书本与黑色越野车被重新组合,由同一组重建资产生成第三套倾倒、滑动与碰撞过程
三段动画复用同一组资产,仅改变初始布局便产生不同轨迹;这不是视频重放,而是物理引擎重新计算的结果。
重建质量与流水线可靠性
团队构建了各含 120 个场景的静态与动态基准,每个场景含 3–5 个对象,并提供 Mesh、轨迹、相机、深度和分割真值。
动态基准上,Scene-IoU-OBB 为 0.440、Object-IoU 为 0.210,速度为 3.35 秒 / 帧。运动类型识别、位姿恢复、有效场景与重力仿真稳定率分别为 95.4%、92.4%、86.8% 和 82.7%,速度较逐帧方法提升一至两个数量级。
当普通视频成为 Physical AI 的数据入口
对 Physical AI 而言,RGB 像素只是入口。策略训练真正需要的是对象边界、几何、尺度、轨迹,以及接触和支撑等能够被执行的状态。OVOW 把视频变成实例级 4D Mesh,再由仿真器改变布局、目标和外力,从同一段观测扩展出多组反事实交互轨迹。
这也使 OVOW 可以成为 D4RT 类数据管线的上游。D4RT 用统一的时空查询接口学习深度、相机和 3D 点轨迹,训练时从带真值轨迹的数据中采样时空查询;OVOW 则能提供对象级 Mesh、相机、深度和运动,并在仿真中生成更长、可控、带真值的 tracking 序列。两者并非同一种方法,但在数据生产上可以衔接:OVOW 负责把真实或生成视频变成可仿真的世界,再输出 D4RT 式重建与跟踪任务所需的训练样本。
数据链|普通视频到实例级 4D Mesh,再到物理仿真、可控长时轨迹,以及 4D 重建、跟踪模型与机器人策略。
因此,OVOW 的价值不只是复现一段视频,而是把一次观测变成可以反复干预的数据源:重新摆放对象,制造碰撞、遮挡和长尾状态,再把这些原本很难采集的过程交给世界模型与机器人策略学习。
ONE VIDEO, ONE WORLD|一段视频,记录的不应只是世界的外观;它也可以成为一个能够被理解、编辑和仿真的物理世界。
作者介绍
作者团队来自清华大学、中国科学技术大学、SparcAI、香港理工大学、电子科技大学、南洋理工大学,关注三维视觉、动态场景理解与具身智能。Junhao Chen 与 Boran Zhang 为共同一作,Yufei Wang 为通讯作者。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.