机器人能力不缺,协作缺位
打开柜门,找到藏在里面的积木,再把它们搭成一座桥。对人来说,几个动作自然衔接就能完成;但对机器人来说,这个任务横跨多种完全不同的能力:找积木需要视觉理解和语言指令跟随,开柜门需要与环境进行复杂交互,搭积木需要几何规划和精准操控并推测环境变化。
![]()
更麻烦的是,这些能力分属多个不同“门派”的模型——VLA(视觉-语言-动作模型)、WAM(世界-动作模型)、RL策略(强化学习)、TAMP(任务与运动规划)。它们各有所长,又彼此割裂,训练方式不同、输入格式不同、状态空间也不同。今天在机器人领域,能力不缺,但协作缺位。
华为诺亚方舟实验室近期发布了一篇论文,提出了名为RoboHarness的系统,专门解决不同策略之间无法协作的问题。围绕这项工作,论文作者与雷峰网进行了交流。
从一次比赛受挫到编排架构
今年夏天,机器人研究领域密集出现了几项围绕Harness展开的工作,它们共同指向一个认知:靠更大的模型解决一切,暂时行不通,机器人需要一层执行组织系统。清华大学于超教授团队在7月发布了Harness VLA,将数字智能中广泛使用的Harness Layer引入具身智能,让一个冻结的VLA专注于最擅长的接触密集操控,同时用一层Harness学会何时、以何种方式调用它,以及在VLA失败后如何重置、如何重试。在LIBERO-Pro扰动评测中,这套系统把成功率从50%提升到82.4%。
思路上,Harness VLA解决的是一个模型如何在分布外扰动下稳定发挥,它的问题是单策略的稳定性。华为诺亚方舟实验室的RoboHarness面对的是另一层问题:当任务超出任何一个模型的能力边界时,怎么办?两者都叫Harness,都用Coding Agent做组织层,但解决的是不同维度的挑战。前者让一个专才变得更稳,后者让一群各有所长的专才协同作战。
这个问题的根源,要从各路模型的能力边界说起。VLA模型的优势在于理解开放式语言指令、在新环境里泛化,但它端到端生成动作的方式,在长时序任务中很难保持一致性;强化学习策略能在特定训练场景内磨出稳定的闭环行为,但这种稳定性高度依赖训练分布,环境稍有变化便可能失效。
TAMP擅长符号推理和几何约束,但需要预先定义动作原语,面对开放场景和模糊目标时规划器很快就会吃力;WAM能通过预测未来状态辅助长时序决策,但容易随预测时域增长产生误差累积。复杂的真实任务同时要求语义理解、几何规划、闭环控制、长时序推理和环境变化推测,这些能力对应的训练目标不同,有时甚至相互冲突。
从各项能力分别取得突破,到单一模型在开放环境里长期稳定兼顾所有能力,横亘着一道至今没有被真正跨越的鸿沟。RoboHarness的出发点正是:与其等待这道鸿沟被填平,不如先让已经存在、各有所长的模型真正协同起来。作者认为,直到某一个模型能够完全压制其他所有模型、展现出绝对的统治力之前,这样的编排架构都是非常有意义的。
这项工作并非凭空而来。作者告诉雷峰网,RoboHarness的雏形诞生于去年参加全球机器人挑战赛BEHAVIOR Challenge的经历。当时赛题任务又长又难,团队发现无论是端到端训练VLA还是用行为克隆之类的模型,都没法覆盖任务本身的难度。这次受挫,反而让团队看清了真正的问题所在。
把异构策略封装成可调度的技能
RoboHarness的核心思路,是把VLA、WAM、RL策略、TAMP等独立开发的控制系统,封装成可以被统一调度的agentic skills,由Coding Agent负责高层决策。这个设计有一个重要前提:不改变、不重训任何底层策略。各个策略保留自己的原始实现,不需要共享模型结构、动作空间或训练数据。RoboHarness只是在它们之上增加了一层组织能力。
选对策略,可没那么容易。对于一个Coding Agent来说,单靠原始图像输入,很难可靠地判断这个任务该派发给谁。因为这个决定背后藏着很多靠语言模型的语义理解能力答不出来的量化问题。它能读懂把杯子放到盘子上,但无法从一张RGB图像里算出当前场景与某个策略训练分布的相似度,更没法评估此刻传感器数据的可靠程度。
为了解决这个问题,系统设计了三类辅助技能,专门替Coding Agent把判断所需的信息提炼出来。
- Understanding Skills:负责将原始输入转化为可量化的信号,比如图像嵌入与各策略训练数据的相似度、物体状态估计和场景图解析,帮助Coding Agent判断当前任务更接近哪个策略的训练分布。
- Monitoring Skills:在策略执行过程中持续跟踪状态变化,检测动作是否卡住、目标是否偏移、传感器读数是否异常,为Coding Agent提供实时反馈。
- Recovery Skills:当某个策略执行失败或陷入停滞时,负责重置环境、恢复初始状态或切换到备用策略,让长时序任务不会因为单点失败而整体中断。
通过这三类辅助技能,RoboHarness把“该用谁、用得怎么样、失败了怎么办”这三个关键问题,从Coding Agent的语义推理中剥离出来,交给专门的量化模块处理。这样一来,Coding Agent只需要专注于高层任务分解和调度决策,而不必被底层感知细节淹没。
作者表示,这种设计让RoboHarness在零样本条件下也能发挥作用。所谓零样本,是指系统不需要针对新任务进行额外训练,也不需要提前见过任务组合。只要底层策略各自具备完成子任务的能力,RoboHarness就能在首次遇到完整任务时,通过编排让它们协同工作。在论文实验中,RoboHarness在多个长时序任务上取得了显著优于单一模型基线的成功率,验证了异构策略协作的可行性。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.