模型会记住已经看到的空间信息,再去推演后续画面,保证三维层面逻辑连贯WorldLabs。
![]()
这两年AI视频生成越来越热闹,不少模型已经可以产出画面流畅的短片,但一直有个绕不开的痛点:镜头稍微转动,画面里物体就容易变形、错位,看不到的背景直接“凭空崩坏”。很多时候想要拍出一段运镜顺滑的视频,只能靠文字描述镜头动作,最终成品效果全靠运气。
9月2日凌晨,李飞飞创办的WorldLabs推出新一代世界模型Atlas,跳出单纯生成2D画面的思路。它不再只盯着图片和视频像素,而是尝试让AI真正读懂三维空间,仅凭少量照片,就能补全镜头看不到的角落、重建完整场景,还可以做时空模拟,把影视特效、3D重建、机器人仿真放进同一套模型里面。不少业内人士评价,这一次,世界模型离现实产业落地更近了一步。
![]()
一、镜头不再靠猜,直接给AI设定摄像机轨迹
普通AI视频工具,想要实现推镜、环绕、拉升这类电影镜头,只能依靠文字描述运镜,模型很难精准理解复杂镜头逻辑,稍微复杂的镜头运动,画面就很容易出现穿模、物体漂移等问题36氪。
Atlas的最大不同,是把摄像机位置、角度这些几何参数当作原生输入。用户不用费劲写一大段提示词形容镜头,直接指定摄像机的运动路径,模型就严格按照设定去生成画面。
哪怕只有一张参考图片,Atlas也可以顺着设定轨迹向外推演,想象出摄像机背后原本没有拍到的场景。它最高可以输出1440p分辨率、时长一分钟的连贯视频,画面的物体结构、空间关系全程保持统一,不会出现镜头一转世界就变样的情况。
![]()
![]()
它还支持360度全景图生成。既可以用文本描述生成全景环境,也可以依托少量图片向外延展,不管是室内房间还是户外旷野,都能产出风格统一的全景素材。
![]()
两张毫无关联的图片,只要在三维空间中分别设定好位置,Atlas还能生成二者之间平滑过渡的完整世界,这对于影视预演、虚拟场景创作来说,是很实用的能力。
![]()
第三方盲测结果显示,面对复杂摄像机轨迹,Atlas对镜头指令的遵循度,明显优于多款主流视频生成模型,轨迹越复杂,优势就越突出36氪。
二、几张随手拍摄照片,就能还原完整三维场景
三维重建一直是计算机视觉领域的难题。过去想要还原一处真实场景,往往需要几十上百张不同角度的照片,还要依靠专门的三维软件处理,门槛高、耗时久。
![]()
Atlas改变了这个现状,输入数量极少的图像,就可以完成场景重建。只输入一张地面拍摄的照片,它就能生成对应的鸟瞰视角,照片拍到的物体忠实还原,没有拍到的区域,依靠模型积累的世界常识合理补全。增加第二张、第三张参考图片,生成的场景细节会进一步收敛,想象的部分随之变少,真实度持续提升。
![]()
团队演示过斯坦福大学主方庭的案例,仅仅25张地面随手拍摄的照片,Atlas就构建出整个校园环境,还可以生成高空俯瞰的飞行镜头,切换多条不一样的摄像机运动路线,无论镜头怎么游走,建筑、草坪的空间关系始终保持稳定。
![]()
如果不希望模型自行脑补未知区域,用户也可以关闭想象模式,只做精确重建。最多可以容纳上百张输入图像,对现实环境做高保真复刻。
![]()
更关键的是,它不只是输出二维图片,还可以直接输出点云、3D高斯泼溅这类标准三维数据。
![]()
创作者拿到结果之后,可以直接导入游戏引擎、特效软件继续加工,不用再做繁琐的二次转换,打通了从照片到可编辑3D资产的链路。在稀疏图像输入的重建任务测试中,Atlas的表现已经超过不少专门做三维重建的顶尖开源模型。
![]()
三、打通时间与空间,把普通素材变成仿真训练场
如果说相机生成、三维重建解决的是静态空间的问题,时空模拟能力,则让Atlas具备了模拟世界动态变化的本事。
普通三台摄像机录制的画面,借助Atlas就可以实现类似大片“子弹时间”效果。时间定格之后,镜头可以自由环绕物体转动,不需要搭建昂贵的多机位硬件阵列,普通拍摄素材就能完成过去影视工业的高难度镜头效果。
![]()
这一套能力对机器人行业意义更大。长久以来,机器人训练最大的痛点之一,就是真实环境采集数据成本太高。真机实地测试,不仅耗费大量人力时间,还存在设备损坏、安全风险。
Atlas实现了“真实到模拟”的工作流程。用手机随手拍摄几段环境视频,模型就重建出完整虚拟空间。模拟机器人在场景里移动,Atlas会实时输出机器人传感器本该看到的RGB画面与深度信息。
![]()
![]()
用户还可以随意修改仿真环境,更换物体、调整摆放位置、改动光照条件,批量生成大量差异化训练场景。机器人可以在虚拟环境中反复完成导航、抓取等任务,积累海量样本,再迁移到真实硬件上,大幅降低机器人研发的数据成本。
四、统一架构,兼顾生成、重建与模拟多项任务
市面上不少AI工具,大多是一个模型专攻一类任务,做视频的只管生成画面,做重建的只负责三维场景,想要完成一套完整工作流,需要来回切换多个工具。
Atlas采用多模态自回归扩散Transformer架构,把文本、图片、视频、相机位姿、深度图全部统一处理,所有输入都被锚定在三维空间上下文当中。
![]()
![]()
这套架构同时吸收大语言模型和扩散生成模型的技术优势,既可以用上KV缓存这类大模型加速手段,也兼容图像视频领域的蒸馏、引导采样等前沿算法,方便后续部署迭代。性能也遵循缩放定律,随着训练计算量提升,整体能力还会持续上涨。
按照团队规划,Atlas会作为底层核心技术,驱动WorldLabs旗下Marble产品迭代升级,未来更多新产品也会基于这套底座开发。Marble此前已经面向创作者开放,支持生成、编辑三维虚拟世界,Atlas落地之后,不管是普通创作者,还是游戏、特效、机器人行业的开发者,都能拿到更强的底层能力Marble。
五、世界模型,正在从概念走向产业
过去很长一段时间,世界模型更多停留在技术演示,好看却很难真正落地干活。Atlas的出现,给出了一套工程化的实现思路:不用把所有希望押在单一能力上,把视频生成、三维重建、时空模拟整合在同一个底座,兼顾创意内容创作与工业仿真两大方向。
当然现阶段它依旧存在局限,一分钟是理论最长生成时长,超长片段依旧会出现细节漂移,目前也还处于早期访问阶段,普通开发者还不能直接调用。
但它打开了新的想象空间。影视从业者可以低成本做镜头预演,游戏团队快速生成环境原型,机器人企业搭建虚拟训练场。AI的竞争,已经不再仅仅比拼文字对话能力,如何看懂、重建、模拟真实三维世界,会成为接下来行业角逐的重要赛道。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.