大语言模型的核心是预测下一个词,视频模型的核心是预测下一帧画面。那如果有一个模型,它的核心任务是预测下一个视角,会发生什么?
World Labs 联合创始人李飞飞给出的答案是:这恰恰是这款新模型的关键所在。她在社交平台上与 Justin Johnson、Ben Mildenhall 以及 a16z 的 Martin Casado 展开了一场对谈,围绕这款刚发布的空间智能世界模型的技术创新进行了深入讨论。该模型试图用"新视角预测"把像素级生成与重建统一到同一个框架里。
![]()
从"下一个词"到"下一个视角"
要理解这款模型的特别之处,先看它和主流模型的分野。
大语言模型建立在下一个词预测(next token prediction)之上,视频模型建立在下一帧预测(next frame prediction)之上。而这款模型选择了一条不同的路——新视角预测(new view prediction)。
这个差异不是换个训练目标那么简单。它意味着模型不再只是沿着时间轴推断后续内容,而是要在空间维度上理解"换个角度看,世界应该长什么样"。李飞飞在对话中强调,新视角预测是实现像素级生成与重建统一的关键。
一个模型,两件事
这款模型被定位为"全球首个多模态世界模型",它的能力清单上有两项核心任务:
- 生成具有像素级相机控制能力的图像和视频帧
- 在 3D 空间中重建这些内容
换句话说,它既能"造"出画面,也能"还原"出画面背后的三维结构。生成和重建这两件事,在以往的模型里往往是分开做的——生成模型负责画,重建模型负责算空间关系。这款模型试图用同一个框架把两者统一起来,而连接点就是新视角预测。
官方给出的描述更直白:建模世界、移动相机、模拟空间与时间。这三个动作放在一起,指向的是一个能理解"空间"的模型,而不只是会生成漂亮画面的工具。
为什么"视角"比"帧"更接近空间智能
视频模型预测下一帧,本质上还是在二维平面上做时间维度的外推。但真实世界是三维的,相机移动时,画面变化不仅来自时间流逝,更来自观察角度的改变。
这款模型把"视角"作为预测的基本单位,等于逼着模型去理解:当相机向右移动 10 厘米,画面里的物体应该发生怎样的透视变化?遮挡关系如何调整?哪些区域会露出来,哪些会藏进去?
这种能力一旦建立,生成和重建就变成了同一枚硬币的两面——生成是从视角预测反推像素,重建是从像素反推视角。李飞飞在对话中提到的"统一",指的就是这个闭环。
创始团队的技术底色
这次对谈的阵容值得注意。除了李飞飞,参与讨论的还有 Justin Johnson、Ben Mildenhall 和 Martin Casado。前两位是 World Labs 的联合创始人,后者来自 a16z。Ben Mildenhall 的名字对熟悉计算机视觉的人来说并不陌生——他是神经辐射场(NeRF)领域的核心人物,这项技术本身就是从一组照片重建 3D 场景的代表性方法。
从 NeRF 到这款新模型,这条技术路线的延续性清晰可见:都是让模型理解"从不同角度看同一个场景"意味着什么。只不过 NeRF 侧重于重建,而这款新模型试图把生成也纳入同一个框架。
空间智能的下一步
李飞飞在对话中反复强调"新视角预测"这个技术支点,背后是她对空间智能的一贯判断——视觉理解不能停留在识别和分类,模型需要真正理解三维世界的结构。
这款模型的发布,把这个判断落到了具体产品上。它能不能成为空间智能领域的"GPT 时刻",现在下结论还为时过早。但至少,它提供了一个值得关注的思路:当所有人都沿着"下一个词"和"下一帧"的方向狂奔时,有人选择了"下一个视角"。
这条路能不能走通,要看这款模型在实际场景中的表现。不过有一点是确定的——空间智能的竞赛,已经不只是比谁生成的画面更逼真,而是比谁更懂"空间"本身。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.