李飞飞创办的World Labs今天放出了一个叫Atlas的模型,官方口径是"全球首个多模态世界模型"。名字听着抽象,但看它干的事,其实很直白:你给它一张图,它能按你指定的镜头角度,生成一段视频,而且画面里的每个像素都跟着你的意图走。
这种控制精度,官方说法叫"像素级精确的相机控制"。翻译一下就是,你让它镜头往左挪一点,画面里的物体透视关系、遮挡关系都会跟着真实变化,不是简单平移画面那种假把式。它甚至能输出最长1分钟的1440p视频,这个规格在生成式模型里不算低。
![]()
它到底能干什么?
Atlas的核心能力拆开看有四块,每一块都对应一个具体的应用场景:
- 相机控制生成:从一张或多张图生成视频,镜头路径由你定,最长1分钟,分辨率到1440p。
- 空间重建:拿一到几十张照片,它能重建出真实场景的3D模型,还能从新视角生成画面,官方说效果超过专门做重建的顶级开源模型。
- 时空模拟:输入一段视频,它能重新构图,增强戏剧性效果,还支持机器人的"真实到模拟"工作流。
- 图像生成:支持文生图,包括360度全景,能跟复杂提示词,还能渲染文字。
这四件事放在一起,其实指向同一个目标:让模型理解"世界是三维的、会动的",而不只是二维的像素拼贴。
"子弹时间"是怎么实现的?
官方博客里提到一个很直观的效果——"子弹时间"。就是《黑客帝国》里那种镜头绕着主角转半圈、背景凝固的拍摄手法。传统做法要架一圈相机阵列,Atlas的做法是:你指定任意摄像机位置和角度,它生成对应的参考图像,而且生成的视图跟输入图像的内容、几何形状能对得上。
更关键的是,它能"自主想象输入中看不到的场景部分"。也就是说,镜头转到背后时,画面不是糊的,而是模型根据空间理解补出来的。这种能力,靠的是World Labs从零开始预训练,让模型接受多模态输入——包括相机移动——然后把这些输入放到3D空间上下文里去理解。
谁先用上了?
World Labs说,部分合作伙伴已经拿到抢先体验资格,未来几周会逐步开放早期访问。目前还没公布具体名单,也没提定价。不过从官方演示看,Atlas在影视预演、游戏资产生成、机器人仿真这几个方向,想象空间都不小。
李飞飞这次押注的"世界模型"赛道,核心赌的是:AI不只会生成好看的画面,还要理解画面背后的物理规律和空间关系。Atlas算是把这张牌亮出来了,至于能不能打穿,得看接下来开放给开发者之后,实际用起来顺不顺手。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.