网易首页 > 网易号 > 正文 申请入驻

李飞飞的世界模型:实现原理、现实影响与未来应用

0
分享至

来源:市场资讯

(来源:图灵人工智能)


转自Agent指北,仅用于学术分享,如有侵权留言删除报道



今天的人工智能已经很会读、写、画,但它对真实世界的理解仍然有限:它可以认出桌上的杯子,却未必知道机械臂从哪个方向抓取更安全,也很难准确推演“推一下杯子,接下来会发生什么”。世界模型要补上的,正是这块能力。

它的意义并不只在机器人领域。对普通用户来说,世界模型可能让家装设计从效果图变成可进入、可修改的三维空间,让游戏和影视创作者用自然语言搭建场景,也让自动驾驶和机器人先在模拟环境中反复试错,再进入现实世界。简单说,它正在推动生成式人工智能从“生成内容”走向“理解并生成世界”。

文章将说明三个问题:世界模型是什么,它如何工作,以及它可能怎样改变我们的生活与工作。

李飞飞创办的 World Labs将目标概括为“空间智能”:让模型能够感知、生成和推理空间,并逐步与虚拟世界和现实世界互动。公司已经推出 Marble 系列世界模型及相关产品;2026 年 9 月 1 日,又公布了全能世界模型 Atlas。

1. 世界模型到底是什么?

可以先从它与大语言模型的区别说起。

大语言模型主要学习:

接下来最可能出现什么词?

例如,看到“杯子从桌上掉下来”,大语言模型很可能会接着说“杯子可能摔碎”。它知道这种因果关系,往往是因为训练文本中出现过大量相似描述。

世界模型则要学习:

当前世界处于什么状态?执行一个动作后,世界会变成什么状态?

假设机器人看到桌子、杯子和地面,它需要在内部完成这样的推演:

杯子放在桌面上机械臂向右推动杯子杯子越过桌沿杯子受重力影响掉到地面杯子可能破碎

也就是说,大语言模型侧重预测语言,世界模型侧重预测世界。它先建立对环境的内部表示,再据此判断某个动作可能带来什么结果。

2. 为什么要研究“空间智能”?

今天的大模型很会“说”,却不一定真正理解我们生活的三维世界。

给人工智能一张房间照片,大语言模型或视觉—语言模型可以告诉你:“这里有桌子、椅子、沙发和窗户。”但真正的空间智能还要回答更多问题:

  • • 沙发离桌子有多远?

  • • 桌子后面还有多少空间?

  • • 机器人能否从中间穿过?

  • • 杯子被推动后会往哪里掉?

  • • 柜门打开时会不会撞到椅子?

  • • 人走到桌子后面,会看到什么?

这些问题要求人工智能从识别物体继续向前一步:理解物体之间的空间关系,推演变化,并据此采取行动。

World Labs 因此希望人工智能能够对物体、地点,以及它们在时间和空间中的互动进行建模。

3. 世界模型如何工作?

一个世界模型可以粗略拆成五层。

第一层:感知世界

模型接收图片、视频、三维数据、深度信息、相机运动、机器人轨迹和动作记录,并从中学习世界的外观与结构。

Marble 已经支持文字、单张或多张图片、视频、360° 全景图和粗略三维结构等多种输入。

第二层:建立内部空间表示

一张图片只是从某个角度看到的世界,真实环境却是三维的。模型因此需要形成内部空间表示,判断:

  • • 物体在哪里,彼此相距多远;

  • • 哪些部分被遮挡;

  • • 换一个视角后会看到什么;

  • • 哪些区域可以通行或操作。

Marble 的输出包括三维高斯泼溅、碰撞网格和全景图等空间表示。三维高斯泼溅是一种用大量带有颜色和透明度的三维点快速重建场景的方法;碰撞网格则帮助系统判断物体之间是否会发生接触或穿透。

第三层:学习世界规律

模型从大量视频和动作数据中观察变化,例如“推杯子,杯子移动”“松开球,球向下掉”“打开门,门绕铰链旋转”,并逐渐学到隐含的运行规律。

这些规律未必会像物理课本那样写成公式,更可能以神经网络参数和潜在空间中的统计模式存在。大语言模型从文本中学习语言规律,世界模型则试图从现实数据中学习世界规律。

第四层:预测未来

有了内部表示,模型就可以连续模拟动作及其结果:

当前状态 S₀ + 动作 A₁ → 世界模型 → 预测状态 S₁预测状态 S₁ + 动作 A₂ → 预测状态 S₂预测状态 S₂ + 动作 A₃ → 预测状态 S₃

人工智能可以先在内部尝试多种方案:

方案 A:从左边抓取 → 撞到盘子 ×方案 B:从上方抓取 → 成功 √方案 C:从右边抓取 → 杯子滑落 ×

比较结果后,它再选择方案 B。这很像人类行动前的思考过程:先想象,再行动。

第五层:与智能体结合

未来的智能体可能组合多种能力:

大语言模型:负责语言、知识和推理世界模型:负责空间理解、物理规律和结果预测规划器:选择行动方案虚拟世界或现实世界:执行行动

模型或系统

主要解决的问题

大语言模型

世界“是什么”

视觉—语言模型

世界“看起来是什么样”

世界模型

世界“如何运行”

智能体

“下一步应该做什么”

机器人

“如何在现实中做出来”

这些能力组合起来,人工智能才可能真正做到能看、能理解、能预演,也能行动。

4. Marble 和 Atlas 已经做到什么程度?

Marble:把图片变成可探索的三维世界

World Labs 的第一个产品是 Marble[2]。给它一张房间照片,它可以生成一个能够改变视角、保持空间一致性的三维世界。

也就是:

二维图片 → 可探索的三维世界

除了图片,它还可以将文字、多张图片、视频、全景图和三维结构转化为可持续存在的三维世界。生成结果能够继续编辑、扩展和拼接,也可以导入游戏引擎、Blender、Maya、3ds Max 等工具。

它和普通人工智能视频生成的区别也在这里:视频生成主要生成一段连续画面;世界模型尝试生成一个空间一致、可从不同角度探索,甚至可以用于模拟的环境。

Atlas:同时生成、重建和模拟世界

2026 年 9 月 1 日,World Labs 公布了新一代全能世界模型 Atlas

。它从头训练,可以直接处理文字、图片、视频和三维数据。技术上,Atlas 采用多模态自回归扩散变换器架构:先把不同输入放进同一个空间上下文,再预测接下来应该生成的画面、结构或变化。

Atlas 目前展示了四类能力:

  • • 镜头控制生成:根据一张或多张参考图片,在指定机位和角度生成新画面;官方演示可输出最长 1 分钟、分辨率为 1440p 的视频。

  • • 空间重建:从一张到数十张图片重建现实场景,补出新视角,并输出点云或三维高斯泼溅等可直接使用的三维结果。

  • • 时空模拟:根据视频理解场景如何随时间变化,改变观察视角,也可以把真实环境转成机器人训练所需的模拟环境。

  • • 图像与全景生成:根据文字或图片生成普通图像和 360° 全景图,并尽量保持空间关系一致。

Atlas 把世界生成、现实场景重建和动态模拟放进了同一套模型。比如,输入一段真实房间的视频,它既可以重建三维空间,也能预测机器人沿不同路线移动时,机身摄像头会看到什么。对于影视创作,这是可精确控制的虚拟摄影棚;对于机器人,它可以成为进入现实环境前的训练场。

Marble 和 Atlas 的关系可以这样理解:

名称

定位

当前作用

Marble

面向创作者和开发者的产品

创建、编辑、扩展和导出可探索的三维世界

Atlas

新一代底层世界模型

统一处理世界生成、空间重建和时空模拟,并为未来版本的 Marble 提供能力

目前,Marble 已经面向用户提供服务;Atlas 仍处于面向部分合作伙伴的早期开放阶段。因此,Atlas 展示的是 World Labs 下一步的技术方向,其能力还不能简单等同于所有用户现在就能直接使用的完整产品。

5. 它对普通用户有什么价值?

最直观的变化,是生成式人工智能将从“给你一份内容”变成“给你一个可以进入和操作的环境”。

比如,你输入“设计一套 80 平方米的日式原木风住宅”。今天的工具多半提供几张效果图;未来的世界模型可能直接生成一套可进入的房子。你可以戴上增强现实或虚拟现实设备走进客厅,移动沙发、更换地板、调整灯光,观察下午的阳光如何落进房间,甚至同步估算装修成本。

对个人创作者、小团队和没有三维建模经验的用户来说,这意味着制作空间内容的门槛可能大幅下降。描述想法,不再只是得到一张图,而是得到一个可继续修改的世界。

6. 哪些行业可能率先受到影响?

游戏

过去制作一个游戏场景,需要策划、原画、建模、贴图、场景设计和程序开发共同完成。未来,一句“生成一座赛博朋克城市”就可能得到可探索的三维空间。专业人员仍要控制美术风格、玩法和细节,但搭建初始场景的成本会明显降低。

影视

导演可以提出“生成一条 20 世纪 80 年代东京雨夜的街道”,再进入生成的环境选择机位、安排角色和调整灯光。此时,人工智能提供的不是一段固定视频,而是一座可以反复取景的虚拟摄影棚。

建筑与室内设计

系统可以把户型图转换为三维住宅,帮助用户比较采光、家具布局和人在空间中的移动路线。设计师也能更快地与客户沟通方案,而不必等到完整建模后才发现理解有偏差。

机器人

在现实中训练机器人代价很高:摔一次就会造成真实损耗,撞到物品也可能带来安全问题。世界模型可以把真实环境转成模拟环境,让机器人先训练成千上万次,筛选较好的策略,再部署到现实中。

World Labs 已将“现实—仿真—现实”列为机器人训练的重要方向,并通过收购 SceniX 推进机器人的空间智能研究。

自动驾驶

现实道路中很难反复收集“暴雨、夜晚、行人突然出现、前车急刹”等危险组合。世界模型可以生成大量边缘场景,让自动驾驶系统在不伤及真实人员和车辆的前提下提前训练。

7. 更深一层:人工智能可能获得“想象未来”的能力

人类搬桌子时,通常不会随机尝试 100 次。我们会先在脑中判断:正着搬可能过不了门,转 90° 或许可以,然后才动手。

这个过程可以概括为:

世界模型 → 内部模拟 → 行动规划 → 实际行动

如果人工智能具备类似能力,它就不再只是根据过去的资料回答问题,而是能够比较几种可能的未来,再决定怎么做。这也是世界模型对机器人和物理世界人工智能格外重要的原因。

当然,“预测得像”不等于“理解得对”。一旦模型对物体、空间或物理规律判断错误,后续规划也会跟着偏离。因此,世界模型真正走进现实设备之前,还要解决一致性、可控性、安全验证和计算成本等问题。

8. 世界模型会怎样改变智能体?

现在的智能体运行框架通常包括工具、记忆、上下文、权限、沙箱、运行循环和评估器。下一阶段,这套框架可能加入世界模型:

                  智能体┌───────────┼───────────┐↓           ↓           ↓大语言模型       记忆       世界模型│                         │语言推理                  世界模拟└───────────┬─────────────┘规划器行动现实或虚拟世界

沙箱的作用是让智能体在隔离环境中“真的试一次”;世界模型则让它在采取行动前,先在内部“预演一次”。前者减少真实操作带来的风险,后者帮助智能体更早排除明显不合理的方案。

9. 世界模型会成为下一类基础模型吗?

未来 5~10 年,人工智能的基础能力可能主要来自三类模型:

基础模型

主要能力

大语言模型

语言与知识

视觉—语言模型

视觉与感知

世界模型

空间、物理规律与世界推演

这些模型会进一步汇入智能体,形成两类执行主体:运行在数字环境中的软件智能体,以及进入物理世界的机器人智能体。

所以,世界模型并不是简单的“下一代 ChatGPT”。更准确地说,大语言模型试图让机器理解人类记录下来的知识,世界模型则试图让机器理解空间、动作及其后果。

如果这条路线取得突破,人工智能的应用范围会从聊天框、办公软件和编程工具,继续扩展到游戏、影视、增强现实与虚拟现实、建筑设计、数字孪生、自动驾驶、机器人和科学模拟。

判断世界模型是否真正成熟,不妨持续关注三个问题:它能否稳定地表示世界,能否可靠地预测变化,能否根据预测安全地采取行动。前两步决定它能否生成一个“像真的”世界,第三步才决定它能否在现实中成为可信赖的行动者。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
他接受纪律审查和监察调查

他接受纪律审查和监察调查

锡望
2026-09-30 10:04:52
演员查德·洛13岁女儿去世,家属发声明

演员查德·洛13岁女儿去世,家属发声明

自愈小日子
2026-09-30 11:54:29
突发!反悔了!4年2.29亿?去TM的替补...

突发!反悔了!4年2.29亿?去TM的替补...

左右为篮
2026-09-30 12:41:39
布鲁斯·威利斯近照曝光,患额颞叶痴呆后鲜少露面

布鲁斯·威利斯近照曝光,患额颞叶痴呆后鲜少露面

这里是美国
2026-09-30 13:51:33
噩耗接连传来!刘欢刚走没几日,63岁水均益近况曝光令人心生担忧

噩耗接连传来!刘欢刚走没几日,63岁水均益近况曝光令人心生担忧

生命之泉的奥秘
2026-09-29 01:11:59
DDR5价格大涨500%,突破1.3万

DDR5价格大涨500%,突破1.3万

半导体行业观察
2026-09-30 09:20:23
网友称钥匙遗落在网约车上,给司机发100元送钥匙辛苦费后被拉黑,官方客服:平台已发放400元作为补偿,并停止派单

网友称钥匙遗落在网约车上,给司机发100元送钥匙辛苦费后被拉黑,官方客服:平台已发放400元作为补偿,并停止派单

潇湘晨报
2026-09-29 10:59:26
高市早苗会晤蒙古国总理乌其尔勒,被日本网友批评在举杯时嬉皮笑脸、粗俗失礼

高市早苗会晤蒙古国总理乌其尔勒,被日本网友批评在举杯时嬉皮笑脸、粗俗失礼

扬子晚报
2026-09-30 12:50:53
人设彻底碎一地!雪瑞姑姑坦白:钻石全是塑料,豪门人生全程剧本

人设彻底碎一地!雪瑞姑姑坦白:钻石全是塑料,豪门人生全程剧本

乡野小珥
2026-09-29 12:48:08
曝拉塞尔签约CBA上海队!被灰熊裁4天再就业 NBA已赚取1.86亿

曝拉塞尔签约CBA上海队!被灰熊裁4天再就业 NBA已赚取1.86亿

颜小白的篮球梦
2026-09-30 14:12:37
韩媒:王钰栋破门后竟还跳崔伞舞大肆庆祝,谢天谢地李英俊扳平

韩媒:王钰栋破门后竟还跳崔伞舞大肆庆祝,谢天谢地李英俊扳平

懂球帝
2026-09-30 15:07:13
没想到,欠债上亿后失联的密春雷,早就给妻子董卿安排好“退路”

没想到,欠债上亿后失联的密春雷,早就给妻子董卿安排好“退路”

观察者海风
2026-09-29 20:46:33
40岁纽约时报总监遭7旬华裔岳父母枪杀,案发原因疑为不满女儿外孙遭受家暴,老夫妇轮流开枪,杀人后平静离开现场

40岁纽约时报总监遭7旬华裔岳父母枪杀,案发原因疑为不满女儿外孙遭受家暴,老夫妇轮流开枪,杀人后平静离开现场

大风新闻
2026-09-29 15:50:25
ESPN:唐斯愿降薪续约,但认为尼克斯要求不合理

ESPN:唐斯愿降薪续约,但认为尼克斯要求不合理

懂球帝
2026-09-30 10:28:23
不查不知道,一查吓一跳!身为日乒一哥的张本智和,学历到底多高

不查不知道,一查吓一跳!身为日乒一哥的张本智和,学历到底多高

幽棠的趣式
2026-09-28 16:55:57
本科天师大,两个英国一年硕,裴轶是怎么进北理工当老师的?

本科天师大,两个英国一年硕,裴轶是怎么进北理工当老师的?

听心堂
2026-09-29 13:43:29
亚运会0金收官后,王楚钦不再隐瞒,原来他和孙颖莎的处境一样

亚运会0金收官后,王楚钦不再隐瞒,原来他和孙颖莎的处境一样

林子说事
2026-09-30 05:53:19
亚运会奖牌榜刷新!日本183枚,韩国95枚,中国单日狂揽24枚奖牌

亚运会奖牌榜刷新!日本183枚,韩国95枚,中国单日狂揽24枚奖牌

观史搜寻着
2026-09-30 07:27:49
刘欢豪宅一览表:装修值千万,客厅能容百人,有私家酒吧,从不请保姆

刘欢豪宅一览表:装修值千万,客厅能容百人,有私家酒吧,从不请保姆

火鱼观点
2026-09-27 19:25:53
赖清德最新民调惊人,国民党在台北全面失守,蒋万安处境很危险?

赖清德最新民调惊人,国民党在台北全面失守,蒋万安处境很危险?

零洛浮华
2026-09-29 13:30:19
2026-09-30 16:03:00
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4938875文章数 9699关注度
往期回顾 全部

科技要闻

OpenAI凌晨大上新!新助手dots迎战Muse

头条要闻

妈妈把12岁儿子留在出租屋独居 带着另外3个孩子搬走

头条要闻

妈妈把12岁儿子留在出租屋独居 带着另外3个孩子搬走

体育要闻

石雨豪:亚运金牌与背后的十年

娱乐要闻

金鹰这夜,演员争辉,有惊喜,反差

财经要闻

中央财政首次贴息房贷 定向支持首套刚需

汽车要闻

真实力用“大考”亮出来 猛士X700开启预售 24.98万起

态度原创

时尚
旅游
房产
手机
军事航空

老板,我的脑子好像忘在家里了

旅游要闻

古人旅游也爱打卡?从泰山石刻看古代版的“到此一游”

房产要闻

海棠湾这个低密大盘现房取证!这或许是未来高端旅居的新趋势!

手机要闻

华为新专利曝光:Pura也能外挂巨炮 看齐Mate 90 Pro Max

军事要闻

美军最后2500人撤离伊拉克

无障碍浏览 进入关怀版