世界模型的本质,并非生成更逼真的视频,而是预测世界的下一个状态。
7月17日下午,在世界人工智能大会(WAIC 2026)主论坛“从虚拟到现实:世界模型如何驱动具身智能”讨论环节,智元合伙人、高级副总裁、具身业务部总裁、觅蜂科技董事长兼CEO姚卯青表示,世界模型的本质是“能够理解物理世界运行规律的 AI 系统”,其中最重要的功能是能够预测世界的下一步状态。
在姚卯青看来,世界模型需要掌握三项关键能力:一是多模态融合理解能力,能理解环境的变化;二是掌握物理规律,包括动力学及时空理解;三是因果推理,具备长程推理而不崩坏的能力。
![]()
今年以来,世界模型备受瞩目,姚卯青指出,现有工作多基于视频生成预训练模型,其展现的能力仍偏重于视觉渲染。这导致了根本性的错位:互联网视频的数据分布,与机器人所需的物理世界预测相去甚远,前者甚至充斥着大量反物理规律的娱乐内容。
“世界模型的核心本质,是能够去理解物理世界运行规律的一个AI系统。”姚卯青强调,它必须原生掌握几项能力:理解多模态信息、掌握动力学与空间规律、具备因果推理能力——而非简单模拟画面序列。“它必须理解作用了一个力,这个物体才被移动。”同时,它还需支持长程推理,并在过程中保持逻辑稳定。
数据,是横亘在理想与现实间的鸿沟。姚卯青认为,要达到高阶智能,真实物理世界的数据量级需达到“亿小时级别”。作为参照,主流大语言模型领先团队的预训练数据已达100万亿token,等效于100亿小时的英语对话——且语言信息密度高、噪声低。相较之下,物理世界多模态数据冗余巨大,有效信息提取更为艰难。因此,构建源自真实、包含丰富原子动作(推、拉、拧、拽)及与各类物体交互(柔性、摩擦、流体)的数据集,成为关键挑战。
上个月,智元进行了一场全网直播的产线真实计时测试:在六天、每天十余小时的连续作业中,一整个工段的机器人编队完成了超六万件产线操作,整体成功率高达99.99%,节拍接近人类水平。“我们相信,行业内会有越来越多这样确定性、刚需的任务被机器人应用。”
展望具身智能在未来三年落地应用发展前景,姚卯青认为,短期来看,高频刚需、环境可控、确定性强且具备容错空间的场景最容易落地。而家庭等更开放的环境和任务,则需要行业构建更加通用、可泛化的能力来逐步解锁。
姚卯青分享的全文
世界模型,可能和它最早出现在强化学习领域里面的这个定义有一定关系,我们认为它核心的一个本质,是能够去理解物理世界的运行规律的一个AI系统。
基于这样一个AI系统,它最重要的功能是能够去预测世界的下一个状态,而不是说简单的去渲染世界的下一个画面或者是内容,更本质的是去预测下一个状态。
要具备这样的能力,我觉得它需要去很好的原生地掌握几个技能:
第一个是必须去理解多模态,能够去接受现实世界中各种种类的一个信息,能把它融合在一起去理解环境的变化。
其次它能够去掌握很多物理规律,包括动力学的,对空间的一个理解,再者它必须要有一定的因果推理的能力,而不是比如说简单的模拟这个画面的一些发生的序列。它必须理解作用了一个力,这个物体才被移动,或者推导它是有因果的关系。
还有一个就是可能它需要具备一定这种长时间长程的推理,而不会在这个过程中去崩坏。
今年,世界模型非常火,大家有很多工作包括一些BP,但是核心问题是现在展现出来能力还是偏视觉生成,大部分这个架构以及工作是基于一些视频生成类的预训练模型,然后在此基础上去具身生或世界、物理世界一些数据去做后训练。
这里面,我觉得可能有两个问题,第一是它的数据分布和我们真正需要的,比如说机器人领域去掌握的这些对未来状态预测、对技能对动作的一些规划是不太一样的。很多都是从互联网上来的,内容有些是娱乐性质的,有些甚至是创作性质的,它反而是反物理规律的。因为大家喜欢看一些天马行空,人也可以飞起来,这种非常反物理规律的一些事情,如果我们要把它严肃的运用到像具身智能的一些场景,一定还需要去原生的去构建真实的数据,它必须要接触很丰富。其次它要具备各种各样的原子动作,推拉拧拽,还要有很多和不同形态物体交互的过程,柔性的、带摩擦力的、流体的等等,这些一来是互联网上比较少的,二是通过现有的一些物理引擎很难去模拟的这样一个状态。
这个数据规模,现在是一个很大的挑战。在我们看来,可能要达到更高阶的一个智能,像人一样判断,对很多物理常识的预测,它可能甚至是要到亿小时这个级别,因为现在主流的大语言模型预训练数据,国际领先的一些团队都到了100万亿的token,那么等效这个正常英语语速说话,其实它是100亿小时。语言是一个比较信息密度高且噪声很低,所有的话都是基本上有含有意义的,这样一个系统尚且要100亿小时的说话。
对于物理世界这样且多模态信息冗余很大,很多都是帧与帧之间的重复信息,或者说一帧之内背景的无效信息来讲的话,它可能真的需要亿小时以上的来自于真实世界数据,才能去很好的掌握这样一个系统的了解。
同时为什么要物理世界本身,我们说到这种视频类的数据,它就是一个我们叫POMDP,它是一个部分可观测的马尔科夫系统,然后更需要能够尽可能多的在我们这个Domain之内去获取这些相关的信息,所以数据很重要。
这是一个非常可见的一个时间窗口,我们认为它还是要遵循一个逐步发展的一个过程。短期之内可能一些高频刚需、环境可控、确定性强,并且具备一定容错空间的场景,相对来讲比较容易落地的,就是简单场景,简单任务。
通俗来讲,围绕这样的一个可能定位,像智元,我们也在逐步开展很多实际应用场景的落地。上个月,我们做了一个全网的六天的直播,它是一个产线的真实计时,在六天每天十几个小时的工作中,我们有一整个工段的机器人编队,它们大概完成了六万多件产线的操作,整体能达到99.99%的成功率,和人类近似的一个节拍。
我们相信,行业内应该会有越来越多出现这样一些确定性、刚需的任务被机器人去应用,像其他一些更开放的环境和任务,像家庭等,需要大家构建一个更加通用、可泛化的这种能力,逐步去解锁。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.