![]()
![]()
家庭,是人形机器人最向往的落地场景,也是技术难度最高的考场。
工厂里的机器人面对的是结构化的流水线,每一步操作都可以提前规划;而家庭环境充满变量,桌面可能堆满杂物,地面可能散落玩具,从冰箱取物时需要侧身绕过椅子,擦桌子时需要随着擦拭范围不断调整站位。这些看似寻常的家务,对人形机器人而言却是巨大的挑战。
![]()
近日,由南洋理工大学、北京大学、香港科技大学(广州)和智源研究院联合提出了ω-0,一款隐空间预测世界动作模型。
据悉,输入语言指令后,ω-0可同步识别环境、感知自身状态,直接输出底层控制系统可读取的精简动作特征,支撑机器人完成“边移动边操作”的全身协同任务。
研发团队对ω - 0模型进行了全方位真机测评,选取了11项高难度居家实操任务,重点考核机器人的动态协同、环境适配与自主决策能力,涵盖了跨区域物品收纳、高低位杂物清理、床上衣物拾取等典型复合场景。
实测结果展现出了ω - 0模型卓越的性能,ω - 0 Ego第一视角任务成功率达79.1%,ω - 0 Omni全场景模式成功率高达81.8%,全面超越了π - 0.5、EgoVLA、GR00T - N1.7、ψ - 0等主流行业基线模型,它的出现似乎正在重塑人形机器人的居家作业模式。
01
从“先走后做”到“边走边做”,ω-0的破局之道
过去几年,机器人的行走能力和操作能力都取得了长足进步。但当这两项能力被部署到人形机器人身上时,一个尴尬的问题浮现了,大多数系统采用“分步走”的策略,即机器人先移动到目标附近站稳后,再启动手臂完成操作。
这种模式在简单场景下尚可应付,一旦遇到需要连续作业的家庭任务,弊端就暴露无遗。擦一张大尺寸桌子时,机械臂伸到极限后必须迈步才能继续,但迈步的同时还要保持抹布始终贴住桌面;拖地时,拖把的运动直接影响身体受力,双腿必须随手臂动作不断调整重心。任何一个环节独立决策,都可能造成动作卡顿、接触中断甚至失去平衡。
基于这些问题,ω-0选择直接摒弃了耗时的视频到动作(video-to-action)逆向转换,转而构建了一个统一的查询表征(Query-based Representation)。
在这一架构中,未来视觉特征提供了任务进度和场景演变的宏观指引,而动作分支则直接生成可供底层控制器执行的全身动作潜在指令。
![]()
并且为了让人形机器人能够更好地适配真实居家场景的复杂需求,研发团队还搭建了三阶段递进式训练体系。在第一阶段,进行全身动作VLM专属预训练;第二阶段是人机动作隐变量融合预训练,此阶段模型借鉴V - JEPA先进技术思路,融合视觉、语言、机器人本体多维数据,通过视频查询预判未来环境特征,将场景动态变化信息注入动作表征体系;第三阶段为真实场景精细化微调,基于前两阶段的训练成果,团队引入海量真实居家移动操作数据,让机器人能够自主适配各类居家场景。
![]()
与此同时,为了支撑庞大的训练需求,研究团队还开源了一个真实世界家庭人形机器人数据集ω-HOME,降低了下游任务训练对示范数据的依赖。
该数据集包含40.3小时的真实环境数据、4827条任务轨迹、24项任务。其中,每条轨迹均包含同步采集的语言指令、第一视角与第三视角、本体状态、全身运动轨迹等数据。
总而言之,81.8%的成功率是一个令人振奋的数字,但它远不是终点。距离一个能真正融入家庭、长期自主运行的机器人的出现,还有很长的路要走。但它的出现,却为整个行业指明了一个方向,那就是将机器人的全身成为一个整体来思考,而不是把腿和手当作两个各自为政的部门。当机器人学会在移动中操作、在操作中调整姿态,才有了从“实验室演示”走向“生活化服务”的可能。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.