五级路线图首次公开
8月19日,世界机器人大会的一场分论坛上,生数科技创始人兼首席科学家朱军给出了通用世界模型的分级框架。按他的划分,通用世界模型一共五级,逐级往上,生数科技的研发和落地覆盖到了第三级。
![]()
眼下AI圈对通用世界模型的定义各说各话。视频生成公司把它讲成模拟器,机器人公司把它讲成决策大脑,自动驾驶玩家也在往里下注。朱军这次给出的答案,试图把散落的说法收拢到一个框架里。
从学骑自行车说起
朱军的定义从第一性原理出发。他打了一个比方:人学骑自行车、学开车,都是从笨拙到熟练。这个过程里,大脑并没有死记硬背动作,而是在与外部世界持续互动的过程中,逐渐建立了一个关于世界如何运转的内部模型。
映射到机器上,通用世界模型需要三项彼此关联的能力:理解世界、预测未来、采取行动。理解世界是看懂环境、判断状态;预测未来是预判接下来会发生什么、不同动作带来什么结果;采取行动是影响数字或物理环境,并用真实反馈修正理解与预测。
“通用世界模型不是单一的生成器、模拟器、机器人动作模型或策略模型,也不是这些能力的割裂片段或简单线性串联,而是三种能力耦合在一起的闭环反馈系统。”朱军说。
数据金字塔与MoT架构
通用世界模型终究是大模型,算力、算法和数据三件套一样绕不开。数据层面,朱军给出了一个多层金字塔:最底下铺海量网络视频,往上是领域视频,再往上是第一视角的人类视频和带动作记录的人类示范,塔尖是真实机器人交互数据。越往上数据越稀缺,成本越高,跟任务动作和物理结果的联系也越直接。
架构上,生数科技的答案是MoT,即Mixture-of-Transformers。不同模态各配专属参数,再用共享注意力打通跨模态交互,环境理解、状态预测、动作生成就都能在同一个模型里跑。世界动作模型Motubrain建在这套架构上,把理解和预测跟行动装进一个模型,不再按模块切开各管一段。
前三级的落地实践
模型对世界理解得越深,跟世界的交互越强,自主性越高,层级就越高。生数科技这几年的实践落在前三层。
- L1 世界生成:让模型学会生成连贯的世界演化过程,视频是最典型的载体,对象、运动、空间关系、时序变化都从这里学起。
- L2 与世界交互:模型能接住实时输入,语言、语音或控制信号进来,后续内容跟着变,一次生成变成了持续互动。
- L3 在世界中行动:模型跨进物理世界,环境理解、未来预测、动作生成要真正统一,直接输出机器人能执行的动作,再拿真实反馈持续修正。
再往上是L4自主世界智能体,围着长期目标主动感知环境、拆解任务、探索没见过的状态、持续规划行动;以及L5世界组织者,视野放到单个智能体之外,机器人、数字智能体、人、工具都归它调度,做多智能体之间的任务分配与协作。
Motubrain的数据表现
Motubrain是生数科技眼下最能打的一张牌。生数科技给出的数据显示,Motubrain推理速度比Motus快了约10倍,换一个机器人本体,50到100条人类示范数据就能完成适配。RoboTwin 2.0基准测试拿下96.1分,排在榜首,银河通用、星尘智能、千寻智能等近十种本体上已经跑通了验证。
L1到L3有了相对具体的技术实践,但离高阶世界智能还远。视频模型的生成质量、可控性、时空一致性都有待提高,世界动作模型放进更复杂更开放的真实环境,稳定性、泛化能力、执行效率也需要优化。
迈向L4和L5的六项挑战
再往L4和L5走,朱军指出了六项关键挑战:建立覆盖理解、预测、行动和迁移能力的联合评测体系;学习接触、摩擦、作用力和干预后果等真实物理规律;形成持久且可修订的记忆;通过真实交互实现在线学习与自我进化;满足现实延迟与资源约束的高效闭环部署;以及安全性与可控性。
“当理解、预测与行动真正形成闭环,世界模型将不再只是生成内容的模型,或执行任务的机器人策略,而会成为连接数字世界与物理世界、迈向通用具身智能的重要基础。”朱军说。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.