机器之心发布
![]()
视频链接:https://mp.weixin.qq.com/s/XyfeX4BABDtbC6u8tF5g0A
机器人撬开啤酒瓶盖,啤酒泡沫涌起,酒液从画面右下角流入杯中。
看起来就像一段普通实拍视频。但你很难想到,但实际上画面中的机器人、物体乃至啤酒流动的未来状态,都来自模型读取机器人动作后生成出的视频。
这些画面来自Current Robotics最新发布的CurrentWorld-0,在他们发布人形全身精细操作 Curr-0 后交出的第二份工作。
团队将其描述为一种交互式世界仿真器(Interactive World Simulator)。它和传统物理引擎不同:不靠人工编写物理公式,而是从真实世界数据中学习规律,形成一种数据驱动的仿真方式。
类似方向此前已经出现过,例如 1X 的 1X World Model、Physical Intelligence 的 Ctrl-World 和 SC3-Eval、DeepMind 的 WorldGym,以及英伟达的 Cosmos Predict。
但这是首次将跨本体、多视角和力触预测整合进同一个世界仿真器中,同时用于模拟、学习,以及与人类和机器人模型交互。
在这个世界里,你看到的不仅是简单的双臂夹爪。移动机器人、配备灵巧手的双足人形机器人,也能被建模和控制。
它们处理的对象也不只是刚体。机器人可以叠袜子、收拾枕头、抹面包,也可以削黄瓜。无论是柔性物体还是流体,都能保持合理状态。真正值得关注的并不是画面有多像真实视频,而是当机器人的动作发生变化后,模型仍然需要让不同视角、不同物体以及接触过程沿着同一个物理事件继续演化。
Scaling Evaluation:
机器人也需要一个可以无限扩张的考场
那这样的世界仿真器可以用来做什么?一个很直接的答案,是评测机器人。
今天训练一个大模型,我们可以同时跑成千上万个 benchmark case,快速知道模型哪里变好了、哪里退步了。
但到了机器人这里,事情突然重新变得 “物理”。机器人数量、场地、人工看护和任务复位,都限制着测试规模。真实世界不可替代,却很难成为一个可以无限复制的考场。
传统物理仿真解决了一部分问题。Isaac Sim 等仿真器可以并行运行大量实验,但前提是:你得先知道这个世界该怎么被建模。刚体、摩擦和关节可以人工定义,但折袜子、抹面包、倒啤酒背后的柔性物体、流体和复杂接触,很难被一条条写进物理引擎。
有没有可能把真实世界本身 “学” 进一个可以无限运行的环境里?
这正是 CurrentWorld-0 想做的事情:直接从真实交互中学习,当机器人做出一个动作后,世界接下来会发生什么。
如果预测足够可靠,大量策略就可以先在模型生成的世界中运行、失败和比较,再把最关键的问题带回真机。
但用于机器人评测的世界模型,不能只是生成一段逼真的视频。换一台机器人,世界规律不能改变;换一个视角,改变的只能是观察;发生接触时,视觉、力觉和触觉也必须描述同一个物理过程。
因此,CurrentWorld 将能力集中在三个方向:跨本体(Cross-Embodiment)、多视角(Multi-View)和力 - 触觉(Force-Tactile)。
它们最终解决的是同一个问题:
无论谁在观察、谁在行动,世界都应该是同一个世界。
CurrentWorld-0 的解法:
什么样的世界仿真器,才能真正用来验证机器人?
首先有一个最基本的前提:机器人的动作必须真正算数。
视频模型拥有很强的视觉与运动先验,但这对机器人评测未必总是好事。机械臂已经抓偏,模型却可能沿着更熟悉的轨迹继续生成,让物体 “自动” 跟着夹爪移动;任务实际失败,画面却补出了一个成功结局。
一旦世界模型开始替机器人纠错,评测也就失去了意义。
Current Robotics 此前发布的dWorldEval(发表于 ICML 2026 Spotlight),研究的正是这种动作可控性:机器人执行了什么动作,环境就必须给出与之对应的结果。动作没有做对,世界也必须允许失败真实发生。
在此基础上,CurrentWorld 进一步解决三个问题。
第一,让不同身体进入同一个世界。
固定双臂、移动双臂和人形机器人的自由度、运动学结构和控制方式都不相同,因此 CurrentWorld 并不强行让它们共享一套动作空间,而是为不同机器人保留各自的Action Subspace。
不同的是身体,相同的是它们作用于世界时遵循的物理规律。
Cross-Embodiment 的目标,就是让不同机器人用自己的方式行动,却共享对同一个世界的理解。
第二,让不同视角看到同一个世界。
头部、腕部和第三视角相机看到的是同一场交互的不同切面。一个视角中的物体发生移动,其他视角里的状态也必须同步变化;即使短暂被遮挡,再次出现时也不能 “换了一个世界”。
CurrentWorld 对多个同步视角联合建模,让它们共同锚定同一套物理状态。
视角可以变化,但世界状态不能随视角改变。
第三,让世界不再只有 RGB。
很多机器人任务,仅靠视觉无法判断交互是否真正成功。同样是夹住一个物体,画面可能几乎一样,但一次已经稳定夹持,另一次却正在滑落;削皮、开瓶、插拔等任务中,真正决定结果的往往也是接触和受力。
因此,CurrentWorld 不只预测未来画面,还同时预测力觉与触觉。
视觉告诉机器人 “发生了什么”,力和触觉则进一步告诉它:接触是否真的发生,以及这个接触正在如何变化。
这让 CurrentWorld 要建模的不再只是一段视觉上合理的视频,而是机器人动作之后,整个物理交互如何继续演化。
失败不是终点,
而是下一轮训练的起点
但评测如果只是告诉你 “机器人失败了”,还不够。
更重要的问题是:能不能从失败的位置继续出发,产生新的训练数据?
在 CurrentWorld 中,策略可以先自主执行。当机器人进入潜在失败状态,人类可以直接接管,通过遥操作完成纠正;同一个中间状态还可以被保存、回滚,再尝试不同的恢复方式。
这延续了 Current Robotics 此前Hi-WM(Human-in-the-World-Model,发表于 RSS 2026 Robot World Models Workshop)的思路:把原本一次性的失败,变成可以反复探索的数据节点。
而在 CurrentWorld 中,人类介入后产生的不只是动作轨迹,还包括同步的视觉、力觉和触觉反馈。
于是,评测不再只是训练的终点,而开始成为下一轮训练数据的入口。
机器人在哪里失败,就从哪里产生新的经验。
世界模型,
最终要回到机器人学习的全链路
把 CurrentWorld 放回 Current Robotics 的技术路线,它的位置会更清楚。
HumanEx提供真实人类行为数据,Curr-0从中学习全身移动与灵巧操作能力;策略进入CurrentWorld接受评测、暴露失败,再通过Hi-WM在失败附近引入人类接管,产生新的纠错数据。
这形成了一条完整的循环:
真实经验 → 模型学习 → 世界模型评测 → 暴露失败 → 人类纠正 → 新数据 → 再训练。
真实世界始终是经验的来源,也是机器人最终接受检验的地方。CurrentWorld 所做的,是把两次真实执行之间的空间拉长 —— 让策略可以更快地被验证,让失败可以被重新访问,也让新的经验从失败中继续生长。
机器人不会因为生成更多 “正确” 的画面而变得更聪明。
真正推动能力向前的,是每一个动作都有后果,每一次失败都能变成新的经验,并最终重新回到现实世界接受检验。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.