无本体数据路线首次贯穿预训练与后训练
穹彻智能刚刚发布具身智能预训练模型 Noe-0。与以往依赖遥操作采集数据的技术路线不同,Noe-0 在预训练和后训练阶段都使用无本体数据,训练全链路不依靠传统遥操数据。团队称,所有自采训练数据都来自人在真实环境中直接完成操作的记录,覆盖超 50 个城市、数十万小时、数十万种任务类型。
![]()
研究团队观察到,同一任务通过遥操作完成通常需要直接操作的 3 至 5 倍时间,不仅增加采集成本,也容易产生缓慢、机械的动作数据。因此,摆脱标准化工位的数采被团队视为势在必行。
从标准化工位走向真实环境
传统遥操数据往往在集中场地内搭建大量标准化工位,桌面相似、物体有限、任务流程提前设计。团队认为,这样的环境虽然可被称为“真实场景”,但本质上仍是为数据采集而人为构造。数据工厂可以复制工位,却很难复制真实世界本身。
为了让机器人学习真实世界的知识,穹彻智能的数据采集进入家庭、门店等日常环境,采集员直接面对真实空间中的物体和任务。团队表示,这类数据更接近机器人未来实际面对的世界,也更能体现真实世界的复杂性和多样性。
采集设备 RoboPocket 强调同构设计
为实现在真实世界里的数据采集,穹彻智能打造了数据采集设备 RoboPocket(RP)。团队发现,如果直接沿用面向机器人执行设计的夹爪形态,会限制采集员在真实环境中的操作范围。因此,RP 将夹爪、末端形态、传感器和采集方式放在一起设计,强调“同构设计”:采集端与机器人末端尽可能保持一致,同时兼顾人的操作舒适度和采集效率。
World Action Model 架构支撑跨本体迁移
Noe-0 采用 World Action Model 架构,以视频预测作为核心的高层学习目标。模型接收连续历史帧与相关状态信息,预测未来的视觉状态,既要学习真实世界在交互过程中如何变化,也要把这种对状态变化的理解转化为机器人可以执行的动作。
团队在实践中发现,即使采集数据和最终推理部署之间存在本体差异,Pixel Prediction 依然能显著提升跨本体迁移的效果。原因在于 Pixel Prediction 为模型提供了一种隐式的反事实推理能力:当模型被要求预测未来视觉帧时,它必须从像素信息中区分出哪些视觉变化与任务完成相关、哪些只是本体外观或背景的差异。这种训练压力迫使模型学会过滤掉与本体绑定的表面信息,抓取真正驱动任务进展的物理本质。
这一发现意味着,无本体数据不仅是一种低成本、高质量的采集方案,更说明无本体数据与 World Action Model 能够实现匹配,帮助从无本体数据迁移到机器人智能。
数据分布规模化成为关键
具身智能模型需要大规模数据已是行业共识,但“大规模”常被用来指代两种不同的东西:第一种是数据量的规模化,同一类任务被重复采集更多次;第二种是经验分布的规模化,模型见过更多种类的任务、更多种物体、更多种空间、更多种现实世界中的变化。
穹彻研究团队认为第二种规模化更加重要,并给出公式:Distributional Scaling = More Data × More Tasks × More Objects × More Spaces × More Real-world Variation。团队决定打造一系列 AI-Native 的数据基础设施,以支撑 Noe-0 的全链路无本体数据训练。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.