![]()
攻克机器人长任务、多控制行业痛点,流形空间三大新品推动世界模型进入物理中心时代。
编辑丨李希
我们经常会思考:是否真的存在像人一样可以持续推理执行的机器人大脑?这家国内最早基于自研世界模型用于具身的公司发现了行业发展中的很多瓶颈:
有分别聚焦相机轨迹、机械臂动作、手部动作位姿这些不同动作控制的世界模型,但未有一个能将多模态控制全部集中在同一个物理世界的。
当前机器人推理大多只呈现了简单抓和放。面对整理桌面、折叠衣物、制作咖啡等长程任务,模型容易遗忘进度、重复动作。
现有世界动作模型大多局限于通过文本指令下发指令,难以通过展示动作完成时的目标图片、人类示教视频等多模态信息下发动作指令。
当下主流的模型评测中,没有能同时评测世界模型作为强化学习训练环境、作为策略模型真机精度、以及拓展到多模态视触觉扩展能力的全栈评测体系。
围绕这些问题,官宣了一年6轮、preA轮获近10亿投资的Manifold AI流形空间,给市场交出了三项新成果,分别从世界模型多专家混合、世界动作模型记忆增强到世界模型多模态评测全栈破局。值得一提的是,这次发布的V2系列全栈距离今年2月份的V1全栈发布,不到半年。据悉,今年内,流形空间还将发布原生统一世界模型(Unified World Model),将世界模型带入真正的GPT时刻。
01
WorldScape 2.0:
业内首个世界模型MoE框架开源,
统一异源控制训练
此次开源的WorldScape 2.0,是让 locomotion、robotic manipulation 和egocentric hand motion 等主流控制信号在同一个世界模型里共同学习,让模型遵守物理一致性和动作因果。
WorldScape 2.0 将 MoE 引入 Diffusion Transformer:共享专家负责沉淀跨控制的世界知识,专属专家负责解释某一种控制接口下的细粒度动作含义。这与普通dense mixed training 有本质区别,后者会把不同控制接口混进同一条参数路径,容易出现梯度冲突,WorldScape 2.0 则把异源监督从“互相拉扯的训练噪声”,变成“共同放大的世界知识”。一句话概括:WorldScape 2.0统一的不是动作格式,而是动作作用于世界之后的动态规律。
这让世界模型的扩展方式发生变化:过去是“为每种控制重新造一个模型”,现在是“往同一个世界里接入一种新控制”。WorldScape 2.0 的意义不只是“支持了三种控制”,未来无论加入单臂机器人、灵巧手、移动底盘、全身 humanoid 动作,还是触觉、力反馈、工具轨迹等更复杂监督,都可以沿着这一路径继续扩展。实验证明,多专家的混合训练使得单个专家也能取得最优性能,WorldScape 2.0在通用世界模型权威评测榜单长期占据榜首位置:
![]()
![]()
WorldScape 2.0在李飞飞团队发布的World Score榜单中排名第一
WorldScape V2项目主页:https://worldscape-moe.com
02
WorldScape Policy 2.0:让机器人
拥有记忆和多模态Prompt交互能力
现有 World Action Model(世界动作模型)大多只依赖当前观测或短时窗口。面对整理桌面等长程任务,模型容易遗忘进度、重复动作。为此,Manifold AI 流形空间推出WorldScape Policy 2.0,其核心贡献:
▎推理增强的长短期记忆
统一短期视觉动态、长期事件进度与隐式子目标推理,使机器人能够从高层指令出发进行长时程自主规划。
▎统一自主推理和多模态prompt实时交互推理
同一个模型同时支持高层任务自主推理和细粒度文本控制(language prompt)、目标图片控制(image prompt)、视频示范(video prompt)等多模态实时交互推理。
▎ManipEvent-5M事件级多模态数据
构建近 500 万事件片段,对齐动作轨迹、高层任务、细粒度子任务、目标图片与视频示范,为可控 WAM 提供规模化预训练基础。
此外,WorldScape Policy 2.0也在仿真和真机实战评测中表现领先:
![]()
主流VLA和WAM仿真评测结果对比
![]()
真机评测任务成功率对比
WorldScape Policy 2.0 的价值不只是增加更长的上下文,它还把局部视觉动态、全局任务进度、隐式子目标推理和多模态意图统一到一个世界动作模型中,WAM不再只是一个被动预测未来的模型,而开始成为能够记忆、推理并持续行动的机器人“强大脑”。
WorldScape Policy 2.0项目主页:
https://manifoldai-research.github.io/WorldScape-Policy/
03
WorldArena 2.0 Challenge:构建世界模型的多模态全功能“真考场”
年初,WorldArena 1.0 定义了世界模型的评测问题:世界模型不应只在 “视频像不像” 上被打分,还要看生成结果是否符合物理约束,是否能服务数据合成、策略评估和动作规划。但其在离线和仿真条件下回答这些问题:
如果模型遇到分布外场景会不会崩?
能不能成为策略反复交互的训练环境?
仿真里成立的能力,到了真实机器人上还站不站得住?
——这些问题,正是 2.0 持续往前推进的动机。
因此Manifold AI 与清华大学、CMU、斯坦福、普林斯顿、香港大学、新加坡国立大学、中科院自动化所等顶尖高校联合发布了WorldArena 2.0,其升级体现在:模态上,从纯视觉走向视觉 -触觉建模;功能上,从离线任务评测走向闭环在线强化学习环境;平台上,从仿真器走向真实机器人平台。这意味着Manifold AI 不仅是世界模型技术的探索者,也在主动定义行业评测标准,让世界模型在真机、闭环、多模态的真实压力下接受检验。
![]()
WorldArena 2.0 沿模态、功能与平台三条轴线扩展具身世界模型评测
同时,WorldArena团队发起了IROS2026 WorldArena 2.0 Challenge。本次挑战赛面向全球研究者与开发团队开放,围绕视频质量评测、世界模型在线强化学习环境、真实机器人 WAM 任务三大方向展开,旨在探索世界模型从预测未来到支撑智能体学习与执行的关键能力。
![]()
WorldArena 2.0 Challenge 比赛概览
WorldArena 2.0 项目主页:http://v2.world-arena.ai
文中的三项工作共同指向一个方向:我们不仅需要模型能“生成新世界”,更需要它“影响世界”:支持不同物理模态指令、理解物理规律、记住和执行长程任务。
![]()
此外,Manifold AI流形空间还与“人形机器人第一股”优必选正式签署业务战略合作协议,推动世界模型从技术验证走向规模化商用,让我们看到了公司走向技术公开实践的决心——它期望世界模型的每一次进步,都能被看见、被检验、被复用。
未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!
公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.