![]()
大语言模型的突破,很大程度上建立在互联网规模的文本数据之上。但机器人没有自己的“互联网”:真实世界的数据采集昂贵、缓慢且危险,也很难覆盖实际部署中可能遇到的各种意外情况。
7 月 21 日,李飞飞创办的空间智能公司 World Labs 宣布收购机器人仿真初创公司 SceniX,后者致力于把真实场景转化为可供机器人训练和评估的数字环境。
这笔交易公布后不久,李飞飞与 SceniX 联合创始人李昀烛(Yunzhu Li)做客了一档播客节目,详细解释了这笔交易背后的技术判断、讨论了仿真如何开启下一代机器人技术,以及训练机器人为何需要与训练语言模型截然不同的方法。
World Labs 还同步发表了技术文章《Building Worlds That Train Robots》,首次披露了 SceniX 的“真实-模拟-真实”路径的部分实验结果。
一次从客户开始的收购
去年年底,World Labs 发布世界模型产品 Marble,它可以接收文字、一张或多张图片,将其转换为具有几何一致性的三维世界。SceniX 随后注册使用了 Marble,成为 World Labs 的客户。
李飞飞起初并不知道这家公司与自己过去的博士后李昀烛有关。后来才发现 SceniX 是对方参与创办的公司,她专门打去电话:“原来这是你们的公司。”
随着交流深入,双方发现,两支团队正在从不同方向解决同一个问题。World Labs 擅长生成模型、计算机视觉和三维重建,SceniX 则拥有机器人学习、硬件和物理仿真方面的积累。前者可以帮助 SceniX 更高效地生成数字环境,后者则为 World Labs 补充了此前相对缺少的机器人与仿真能力。
![]()
图 | SceniX 创始团队(来源:SceniX)
“双方的能力高度互补,同时又拥有共同的使命。”李飞飞说。她将 World Labs 定义为一家前沿模型实验室。公司试图构建的是 AI 的下一个前沿——空间智能,即让机器获得生成、理解和推理空间,并与物理或虚拟空间交互的能力。
在游戏、视觉特效和设计等领域,人们可以在虚拟空间里创造和互动;在物理世界里,机器人则要感知环境、理解物体关系,并预测行动产生的后果。两者背后依赖的,都是对空间和世界运行规律的理解。
李昀烛透露,SceniX 起初曾考虑继续独立发展,但在与李飞飞交流并看到双方的协同效应后,团队认为加入 World Labs 是更合理的选择。
当主持人问及 World Labs 是否会推出面向机器人的基础模型时,李飞飞没有否认这种可能。她认为,未来的机器人基础模型很可能是一个包含“动作”的多模态模型:既接收视频、文字、图像等信息,也输出世界状态和机器人动作。
李昀烛进一步解释,当模型把视频帧和动作作为输入时,它相当于一个前向模拟器,用来预测机器人采取某项动作后,环境会发生怎样的变化;当模型根据目标输出动作时,它又接近一个策略模型,负责判断机器人下一步应该做什么。
这意味着,机器人基础模型不能只理解眼前的世界,还要预测动作的后果,并决定如何在现实环境中行动。它也可以作为通用的基础模型,再针对不同机器人和具体任务进行微调。
给机器人造一个可以无限试错的世界
在解释这笔收购时,李飞飞把问题指向了机器人领域最根本的瓶颈:数据。
语言模型能够从互联网获取海量文本,图像和视频模型也拥有相对丰富的公开数据。但机器人需要的不只是画面,还要知道采取了什么动作、环境如何变化,以及动作最终是否成功。
这些数据很难直接从互联网获得。在真实环境中收集机器人数据,需要实体设备、场地和人工操作。每一次训练和评估都必须等待机器人完成物理动作,失败还可能损坏设备或带来安全风险。这意味着,机器人很难直接复制大语言模型依靠数据和计算规模提升能力的路径。
“为了让机器人真正工作,我们必须以某种方式解锁缩放定律的力量。”李飞飞说,“但这些数据从哪里来?这是机器人领域每个人都在面对的深层问题。”
SceniX 尝试用“真实—仿真—真实”路径解决这个问题。
李昀烛介绍,这套路径先将真实环境映射到数字世界。数字环境不仅要捕捉场景的外观和几何结构,还要描述其动力学,即机器人采取动作后,环境将如何变化。机器人可以在数字环境中训练和接受评估,再把学到的策略迁移回现实。理想状态下,数字世界与真实环境需要保持足够的一致性:如果一种策略在仿真环境中的表现得到改善,回到现实后也应出现类似提升。
但传统的环境重建仍然较为笨重。李昀烛认为,Marble 及 World Labs 的其他技术可以帮助团队更高效地重建和生成环境。这也是团队选择加入 World Labs 的原因之一。
双方希望把一个现实任务扩展成大量数字场景。机器人不必只在少数人工搭建的环境中反复练习,而可以面对不同的物体位置、场景布局、光照、摩擦和机器人状态。
从具体用途看,这套数字环境主要服务于机器人训练和评估;从实际价值看,李昀烛将其概括为两点:可靠性和效率。
可靠性来自对更多状态和异常情况的覆盖。在真实环境中,开发者很难系统改变光照、几何结构、摩擦和其他物理参数,也难以主动制造大量危险或罕见情况。模拟则可以有控制地生成这些变化,让机器人反复面对不同条件,观察策略在哪些情况下失效。
效率则体现在训练和评估的迭代速度上。目前不少机器人数据依靠遥操作采集,操作人员通过外骨骼等设备控制机器人,数据采集速度有时甚至低于人类直接执行任务。模拟环境可以并行运行训练,并系统性地加快机器人的动作,同时保留环境动力学的变化。
同期发布的技术文章展示了部分早期结果。任务包括双臂装箱、线缆插接与整理、试管转移,以及从杂乱环境中抓取马克笔和铅笔等。按照 World Labs 的说法,部分策略完全使用模拟数据训练,没有使用真实世界训练数据,随后直接迁移到不同的真实机器人平台;其中一些策略在真实硬件上连续自主运行一小时,无需人工干预。在双臂传递方块的实验中,模拟评估基本保留了不同策略在真实硬件上的相对排名,也呈现出相似的成功与失败区域。
模拟会偏离现实吗?
随着视频生成模型不断进步,利用互联网视频训练机器人,已经成为机器人学习领域的一条重要路线。
但李昀烛认为,一个供机器人使用的世界,关键不只在于视觉效果,而在于“一致性”。它需要在空间、时间、不同视角和不同交互方式下保持稳定。如果机器人正在推动一个物体,物体却在生成结果中突然消失,这个世界就无法提供可靠的训练信号。
对于普通视频而言,短暂的画面错误或许不会影响观看;对于需要据此决定下一步行动的机器人而言,同样的错误可能直接导致任务失败。机器人需要知道的不只是“下一帧看起来怎样”,还包括“采取这个动作后,世界将如何变化”。
不过,仿真也不必复制现实中的所有细节。李昀烛以四足机器人为例:机器人要学习在雪地和灌木中行走,模拟器不需要精确还原每片雪花和每根树枝,而要保留与任务有关的基本结构,并通过不断改变地形和物理条件,让机器人获得迁移到现实的能力。
因此,仿真所需的保真度取决于具体任务。机器人需要的不是一个在所有细节上都完美的世界,而是一个抓住关键规律、能够支持训练和策略迁移的世界。
![]()
(来源:World Labs)
但将模拟作为机器人学习的基础,也面临一个长期质疑:模拟环境终究会与现实产生偏差,真实世界的数据仍然不可替代。
对此,李昀烛认为,模拟与真实数据并不矛盾,而是处于同一个数据飞轮的不同阶段。系统早期可以更多依靠物理规律、几何结构和动力学,保证数字环境具有基本的一致性;随着机器人在现实场景中部署并积累更多数据,环境模型再逐步增加学习驱动的部分。最终形成的不是纯物理模拟器,也不是完全依赖数据的模型,而是两者的结合。
李飞飞则从反事实推理的角度解释模拟的价值。现实数据只能记录已经发生的事情,而模拟可以推演尚未发生、难以发生,甚至不适合在现实中主动制造的情况,帮助机器人提前学习应对方法。人类在制定足球战术时也会进行类似推演。
李飞飞以自动驾驶为例。由于企业不可能在道路上主动制造各种危险情况,Waymo 等公司长期使用大量模拟数据进行训练和测试。相比自动驾驶汽车,通用机器人的动作、身体结构和交互对象更加复杂,对模拟的需求也会更高。
因此,模拟与现实数据并不是两条互相排斥的路线。现实数据为模型提供真实反馈,模拟则创造现实中不存在或无法安全获得的经验。
先进入仓库,再走进家庭
World Labs 与 SceniX 所做的,不是制造某一种具体机器人。主持人将双方的目标概括为:它们不是建造机器人,而是建造一个环境,让其他公司把自己的机器人和模型放进去学习、测试和接受评估。
李昀烛表示,SceniX 的平台尽可能与模型和机器人本体无关。客户可以使用单臂、双臂、固定机械臂、移动机械臂或不同的末端执行器,也可以接入各自开发的策略模型。
SceniX 负责数字环境以及训练、评估基础设施,机器人公司则继续开发硬件和“大脑”。同一个经过重建的数字任务,可以随着时间推移服务不同机器人和不同模型,而不必为每次测试重新搭建环境。
提及当前人形机器人的商业化路径,两位受访者都相对谨慎。李昀烛将应用环境分为三个层次:汽车生产线等属于完全结构化环境;仓库、餐厅和酒店属于半结构化环境;家庭则是充满不确定性的非结构化环境。
他认为,更现实的路径是先进入结构化和半结构化环境,再逐步走向家庭。前者不仅更容易控制,也存在大量明确、能够立即产生价值的自动化任务。
李飞飞从机器人形态的角度补充说,人形机器人模仿了人的身体,而人体是在复杂、开放的环境中进化形成的。它具有较强的通用性,却不意味着在每项任务中都是最高效的结构。对于具体工业任务,更专业化的机器人形态可能更加实用。
![]()
(来源:YouTube)
当主持人问机器人何时能够达到人类水平的能力和能效时,李昀烛认为,这仍需要很长时间。现实中的机器人不是单一模型,而是一套由硬件、软件、控制系统和环境共同构成的系统。即使是机械手指与物体之间的摩擦,也可能决定任务能否完成。
李飞飞将这种态度概括为:“在当今的 AI 领域,最难做到的就是保持一种克制且合理的乐观。”
这种谨慎也体现在收购后的安排上。李飞飞表示,两家公司不会立即把所有代码、团队和产品“像沙拉碗一样拌在一起”。SceniX 已经拥有相对完整的技术栈、产品和客户,需要保留一定独立性;双方将逐步在模拟、动作条件模型和 Marble 应用方面展开整合。
谈到未来两年的目标,李飞飞希望两支团队能够在少数重要垂直行业获得经过验证的客户,证明其系统可以满足现实中的自动化需求,再把这些客户发展为可供业务扩张的标杆案例。
李昀烛补充,目前团队希望接触的客户已经接近实际部署,处理的是相对可预测的任务。这些客户通常拥有数十甚至上百个希望实现自动化的类似场景,一旦机器人方案达到所需的可靠性,就能立即创造价值。
1.https://www.worldlabs.ai/blog/scenix
2.https://www.youtube.com/watch?v=-tabaM5l3s0
3.https://www.a16z.news/p/building-worlds-that-train-robots
4.https://www.worldlabs.ai/blog/real-to-sim-to-real
运营/排版:何晨龙
注:封面/首图由 AI 辅助生成
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.