出品 | 网易科技
作者 | 小扣
编辑 | 王凤枝
在李飞飞的设想里,搭建机器人仿真训练场,只需要几段手机视频。
9月1日,她创办的World Labs发布新一代世界模型Atlas。团队在一组机器人演示中,用两段手机视频分别重建两处大型空间,每段只取24帧,再让不同机器人沿不同路线在其中移动。
![]()
Atlas不是机器人的"大脑"。它要解决的是更前置的问题:把现实环境快速搬进仿真系统,生成机器人第一视角看到的画面和深度信息。灯光、物体、摆放位置和机器人动作发生变化时,也不必每次都重新布置真实场地。
但真正的悬念在于,这座AI搭出的训练场到底有多像真的。
对影视创作来说,镜头没拍到的地方,AI补出一扇门、一面墙,看着像就行;对机器人训练来说,台阶高度、障碍物位置和物体运动一旦猜错,错误也会跟着进入训练数据,最后由真机来买单。
眼下,Atlas还只向少数合作伙伴开放早期访问。价格、公共API和全面开放时间都没有公布,现有演示和测试也全部来自World Labs。
一、拍一次,改一百次
World Labs把这套能力称为Real-to-Sim:先采集真实环境,再把它搬进仿真系统。
在导航演示中,团队从两段手机视频中各取24帧,重建出两个较大的空间。机器人沿着给定路线移动时,Atlas会生成机身相机在沿途看到的彩色画面和深度信息。


官方没有交代这24帧如何筛选,也没有给出不同拍摄质量下的对照。换句话说,24帧只是这次演示送进重建环节的画面数量。换成普通人随手拍的视频,能不能达到同样效果,是另一回事。
过去扫描一处真实空间,往往需要专门设备和更密集的采集。World Labs希望把这一步简化成普通手机视频。场景进入仿真系统后,同一处空间便可以反复使用:换一条路线,挪动障碍物,改变灯光和背景,都不必重新搭建真实场地。
![]()
到了抓取等操作任务,难度又高了一层。官方演示覆盖刚体、带关节的结构和可变形物体,并允许继续改变物体种类、摆放位置和机器人动作。一次实拍,就能变出一批不同的训练和测试环境。

吸引机器人公司的,正是这种可重复使用的训练环境。在真实场地反复布置和采集,环境一变就可能需要重新来过;仿真可以让机器人反复尝试,摔倒了重来,换任务时也更容易调整。Atlas想做的,是让搭建这些仿真环境变得更快。
不过,这些都是World Labs自己放出的演示。Atlas究竟能省下多少成本、能产出多少有效训练数据,还要等外部团队的实测来回答。
二、没拍到的地方,Atlas要自己猜
照片少,意味着模型要补的也多。
一张照片只记录了一个角度。镜头一旦绕到物体背后,原图里就没有答案了,Atlas只能根据已经看到的内容和训练中学到的常识继续生成。
World Labs展示的一个例子里,模型补出了机器人的背面,还猜测泳池旁边应该有一片草坪。输入图片越少,留给模型想象的空间越大;实拍素材越多,它需要猜的地方就越少。
![]()
按照公司的说法,Atlas通常只用两三张图片便能较忠实地重建场景,也可以把100多张图片放进同一个空间上下文。每张图不再只是一张平面照片,还会被放回三维空间中的拍摄位置。图像、相机位姿和深度共同构成上下文,模型由此知道镜头从哪里来、接下来要往哪里走。
Atlas把控制镜头、重建空间和生成仿真整合进了同一套模型。World Labs称其为"多模态自回归扩散Transformer":文字、图像、相机位姿和深度图被组织成序列,模型逐步生成新的画面和深度信息。
![]()
处理真实空间的视频时,Atlas会预测每一帧的深度,再把不同帧合成3D重建。结果可以输出为逐像素3D点、点云,也能进一步转换成3D高斯泼溅。这也是World Labs现有3D世界创作产品Marble采用的表示方式。公司表示,未来版本的Marble将由Atlas驱动。

对创作者来说,这种"合理补全"正中下怀。a16z合伙人Justine Moore把这项能力概括为从新角度"重拍"已有视频:现场只用三部架在三脚架上的手机拍摄,Atlas随后重建出完整场景,让创作者重新选择机位。
但对机器人却未必,它们不能只要"看起来像"。导航任务首先要求空间几何足够准确;抓取和操作还会追问,物体能否按照真实规律碰撞、运动和变形。虽然Atlas官方页面展示了刚体、关节结构和可变形物体,却没有公布这些模拟与现实之间的误差,也没有给出真机迁移的成功率。
它越会补,外界越需要知道它补得有多准。
三、它搭世界,不替机器人做决定
不过在讨论它补得准不准之前,得先看清楚它到底做了什么。
这次演示里,机器人的移动路线已经给定。Atlas重建出三维空间,再沿这条路线渲染出彩色画面和深度图;它没有展示自己判断哪里能走、下一步该做什么,更没有直接输出机器人的动作。
Hacker News上有开发者追问,Atlas能否从空间表示中识别类似地面的可行走区域,用于机器人规划路线。同一讨论中,World Labs联合创始人Justin Johnson解释,Atlas目前介于渲染器和模拟器之间,不会直接预测机器人动作,也不是规划器;它生成的仿真环境可以用来训练另一套负责规划的模型。
![]()
场景在视觉上保持连贯,不等于机器人能在其中做出正确决策,它们还得靠感知、规划和动作策略。
更关键的是,机器人最终面对的也不是屏幕,而是真实世界。《华尔街日报》近期采访的布朗大学机器人学教授乔治·科尼达里斯(George Konidaris)提醒,现实环境存在大量特殊情况和硬边界;机器人移动时一旦撞到某个物体,之后的状态就可能全部改变。
![]()
这种偏差在不同任务上会以不同方式放大。对导航而言,墙面、门洞和台阶的几何误差会影响路线;对抓取而言,物体重量、摩擦和形变只要与仿真不同,机器人在虚拟环境里学会的动作,到了真机上就可能失效。
所以Atlas展示的是Real-to-Sim的前半程:把现实场景变成可生成、可变化的仿真环境。机器人在里面学会的能力能否再从Sim回到Real,还要由后续的策略训练和真机测试回答。
四、首批合作伙伴要验收的,不只是画面
回到Atlas本身,它不只是给机器人用的。World Labs把它定义为同时处理文字、图像、视频和3D的综合世界模型,也能按指定的相机路径生成最长1分钟的1440p视频。虽然在游戏、视频制作等方向上也有潜力,但从公司公布的合作方向看,机器人仿真才是它最被寄予期望的落点。
World Labs目前没有公布首批合作伙伴名单,也没有给出价格、推理速度、长轨迹一致性和机器人真机迁移的结果。对拿到Atlas的团队来说,画面好不好看只是入门门槛,真正要验的是:仿真里的那扇门、那级台阶、那个会变形的物体,到了现实中是否还在同一个位置、还遵循同样的规律。
Atlas已经把拍摄现实、重建空间这一步压缩到了几段手机视频。接下来最难的一关,是机器人走出仿真、面对真机之后。
首批合作伙伴要回答的,就是这一关。
