网易首页 > 网易号 > 正文 申请入驻

告别通用具身模型崇拜:具身智能走向异构策略编排

0
分享至



当 VLA、WAM、RL、TAMP、MPC 等机器人控制策略在各自擅长的任务中大放异彩,如何刻画其能力边界,并在正确的时机为不同子任务匹配最合适的策略,正逐渐成为机器人完成复杂长时序任务的关键。



  • 论文标题:RoboHarness: Memory-Driven Orchestration of Heterogeneous Robot Policies for Long-Horizon Planning
  • Project Page:https://robo-harness.com
  • arxiv link: https://arxiv.org/abs/2607.18060

具身智能正在经历模型能力竞赛:VLA 在 Scaling 的道路上一路狂奔,WAM 弥合未来预测和动作生成,RL 依靠 Reward Design 强化执行稳定性,TAMP 凭借严密的逻辑进行长序推理…

各个策略在擅长的任务上都有独特的优势,但真实世界往往同时要求高度的语义理解、闭环控制、几何精度、长时序推理,远远超出了单一控制策略的能力边界。仰望 “通用具身模型”,只能长叹:“道阻且长”。

RoboHarness: 没有最强的模型,只有最合适的策略。

为什么需要异构策略编排?

与其苦苦等待未来一个通用模型包办一切,不如问问:协同调用现有的控制策略,我们能做什么?

纵观具身智能技术历史长河上闪耀的星辰,VLA 擅长视觉语义理解与开放词汇指令,RL 在特定分布内具有稳定闭环行为,TAMP 擅长逻辑与几何规划,WAM 则通过预测未来辅助决策… 我们不难发现,它们的能力并非是彼此替代,而是在某些方向高度互补。

既然单一策略难以覆盖复杂任务的全部需求,为什么不让异构策略协同工作,在不同阶段各展所长?

从模型竞争,走向异构策略编排

RoboHarness 主要解决两个异构策略协同的关键难题: (1) 如何选择最适合的策略?(2) 异构策略间如何交接?它将 VLA、RL、TAMP 等控制策略封装为可调用技能,由 coding agent 进行高层任务拆解及子任务路由,并在相邻异构策略状态分布不兼容(Out of Distribution)时生成桥接轨迹。系统无需底层策略共享结构、动作空间或训练数据,也无需联合训练,可无痛接入新的底层控制策略,包括 WAM、VLN 或 MPC 等。



图 1|RoboHarness 总体框架。

RoboHarness 提供三类结构化辅助技能:Understanding Skills 调用一系列分析技能,从原始输入中提取更丰富的信息辅助决策;Memory Skills 检索相关的历史执行经验,显式重建下一控制策略熟悉的状态分布,并据此引导机器人进入该分布,实现不同策略之间的稳定交接;Evolution Skills 利用在线反馈更新策略元数据、参数与 Harness 逻辑。

第一步:识别策略的动态能力边界

策略能力边界并非固定不变,它受多种因素影响。VLA 在原始相机位姿下能够稳定执行的任务,在输入图片质量下降后可能会失败。系统需要判断,在当前场景、观测质量和机器人状态下,最有可能成功的控制策略是谁?RoboHarness 利用 Understanding Skills 从原始输入中,深入获取更丰富的信息(语义相似度、位姿不确定性、图像曝光等多维指标)刻画控制策略能力的边界,以辅助高层执行策略的选择。



图 2|不同扰动下的策略调用比例,以及 VLA 独立成功率与调用比例之间的关系。

表 1|LIBERO 与 LIBERO-Plus 成功率(%), RoboHarness 集成了pi0.5和 TAMP 两种底层策略



在 LIBERO-Plus 的多类扰动中,RoboHarness 会根据底层策略的实际可靠性调整调用比例:VLA 越稳定,系统越倾向于调用它;当机器人状态、语言或感知条件超出其能力边界时,则更多路由至 TAMP。RoboHarness 通过多策略协作,在 LIBERO-Plus 上取得 93.2% 的平均成功率,高于其余现有方法。

第二步:解决异构策略之间的 “交接断层”

两个策略之间常存在 “交接断层”:由于各控制策略独立设计,前一策略结束的位置,可能恰好是后一策略从未见过、无法稳定启动的状态。Memory Bridge 根据下一子任务和当前观测,从多模态记忆中检索下一目标策略的成功轨迹,提取末端位姿和关节状态,并在线拟合 “机器人状态 — 执行进程” 的空间分布,显式重建下一控制策略熟悉的状态分布。系统随后综合分布内置信度与运动代价选择目标状态,生成桥接轨迹,再将控制权交给下一策略



图 3|Memory Bridge 构造通路。

长时序任务揭示了单一模型的能力壁垒

长时序任务最能暴露单一策略的能力壁垒。在约为原始 LIBERO 四倍长度的 LIBERO-LoHo 上零样本测试,π0.5 完整成功率仅 6.4%; 即使通过世界模型(H-WM)、LLM(LLM-guided)或规划语言(Logic-guided)分层拆解任务,再交由 VLA 执行,完整成功率最高也仅为 64.8%。这证明了单一模型始终很难突破现有的能力壁垒, RoboHarness 通过协同调用多种底层控制策略并保证稳定交接,将完整成功率提升至 95.2%。

表 2|LIBERO-LoHo 零样本长时序评估。RoboHarness 集成三种底层策略:pi0.5、经 RL 训练的 OpenVLA 和 TAMP。各项结果为任务进度 / 完整成功率(%)。



准确刻画能力边界与实现策略间的稳定交接,

二者缺一不可。

消融实验表明,协同并非简单地将模型串联。缺少 Understanding Skills,系统会因无法准确理解各底层策略的能力边界而出现任务分解和路由错误;移除 Memory Bridge 后,即使选对策略,也可能因交接状态不兼容而失败;缺少 Evolution Skills,系统则难以根据执行反馈修正能力判断,并在线更新各策略的能力边界。理解、适应与交接,缺一不可。



图 4|消融实验:理解、进化与 Memory Bridge 分别解决错误分解、能力估计失准和策略交接失败。

具身智能的竞争,

正在从模型走向系统

“通用具身模型” 仍是所有具身人的终极目标,但在追逐的慢慢长路中,机器人必须正视每种策略的能力边界、输入依赖与分布外脆弱性。异构策略编排提供了一条现实路径:不要求单一模型立即掌握所有能力,而是让系统理解不同策略何时可靠、如何分工和交接。

RoboHarness 逐渐积累跨策略、长时序数据,反哺未来统一具身模型训练。

它不是通用模型的对立面,而是具身智能从模型能力走向系统能力的必由之路。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
2-0后!意甲大黑马诞生:5轮13分+追平国米罗马,26年前曾夺冠

2-0后!意甲大黑马诞生:5轮13分+追平国米罗马,26年前曾夺冠

体育知多少
2026-09-20 06:40:56
一夜关停!杭州头部商K谢幕,网传从业者南下深圳,真相是什么?

一夜关停!杭州头部商K谢幕,网传从业者南下深圳,真相是什么?

火山詩话
2026-09-20 15:34:15
刚刚,中东突传大利好:提交停战条件!不出意外,明天A股这样走

刚刚,中东突传大利好:提交停战条件!不出意外,明天A股这样走

虎哥闲聊
2026-09-20 11:55:26
秦岭挖出无名白骨,8年后中央证实:竟是毛主席亲侄子,年仅19岁

秦岭挖出无名白骨,8年后中央证实:竟是毛主席亲侄子,年仅19岁

听雪禅
2026-09-19 15:30:14
海淀妈妈群里,最近聊的不再是升学,而是“我家孩子也不上学了”!

海淀妈妈群里,最近聊的不再是升学,而是“我家孩子也不上学了”!

观心实验室
2026-09-18 16:18:37
工龄退休呼声越来越高,干三四十年的人,为何要和别人一起熬到点

工龄退休呼声越来越高,干三四十年的人,为何要和别人一起熬到点

白米饭怎么吃
2026-09-19 21:41:27
许晴独居北京大平层57岁未婚,家里请了保姆,一个人早餐吃10道菜

许晴独居北京大平层57岁未婚,家里请了保姆,一个人早餐吃10道菜

椰黄娱乐
2026-09-16 10:20:02
入党前已是少将,授衔时获评开国大将,毛主席亲自特批其享受元帅待遇

入党前已是少将,授衔时获评开国大将,毛主席亲自特批其享受元帅待遇

大运河时空
2026-09-19 19:20:05
大衣哥儿媳越来越漂亮,朱小伟变帅气了!网友:陈亚男要后悔死

大衣哥儿媳越来越漂亮,朱小伟变帅气了!网友:陈亚男要后悔死

娱乐团长
2026-09-20 16:19:09
中菲爆发冲突后,美国做出表态!中方公开撞击视频:海警没踩刹车

中菲爆发冲突后,美国做出表态!中方公开撞击视频:海警没踩刹车

共工之锚
2026-09-20 00:13:51
问界这次的瓜,真的有点大啊!

问界这次的瓜,真的有点大啊!

芝麻科技讯官方号
2026-09-18 00:06:07
无缘奖牌!男篮70:79不敌伊朗,这一战,彻底看清三个残酷事实

无缘奖牌!男篮70:79不敌伊朗,这一战,彻底看清三个残酷事实

谭颞爱搞笑
2026-09-20 17:59:00
陪睡陪玩只是开胃菜,舔手指塞拳头、集体嫖娼、背后的事藏不住了

陪睡陪玩只是开胃菜,舔手指塞拳头、集体嫖娼、背后的事藏不住了

北海史记
2026-08-12 19:57:54
湖北省人大教育科学文化卫生委员会原主任委员郭忠被开除党籍

湖北省人大教育科学文化卫生委员会原主任委员郭忠被开除党籍

环球网资讯
2026-09-20 17:05:15
一年三款车,想想就怕。

一年三款车,想想就怕。

深读时刻
2026-09-19 05:14:10
中国代表团收获首张洛杉矶奥运会门票!上海运动员唐钱婷打破女子50米蛙泳亚运会赛会纪录晋级

中国代表团收获首张洛杉矶奥运会门票!上海运动员唐钱婷打破女子50米蛙泳亚运会赛会纪录晋级

纵相新闻
2026-09-20 15:18:08
毛东东随团访朝 向毛岸英铜像祭酒 背后释放的信号不简单

毛东东随团访朝 向毛岸英铜像祭酒 背后释放的信号不简单

军武咖
2026-09-19 08:59:52
五角大楼疑漏报美军死亡人数,美防长怒喷美媒“恨特朗普超过爱美国”

五角大楼疑漏报美军死亡人数,美防长怒喷美媒“恨特朗普超过爱美国”

澎湃新闻
2026-09-20 16:19:38
退休警察“代持”上亿股权,能用法院判决洗白?

退休警察“代持”上亿股权,能用法院判决洗白?

澎湃新闻
2026-09-20 16:59:18
“这颜值,放艺术生里也是顶级!”家长晒素颜大一女儿哭鼻子火了

“这颜值,放艺术生里也是顶级!”家长晒素颜大一女儿哭鼻子火了

世界圈
2026-09-15 15:50:08
2026-09-20 19:28:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14034文章数 142735关注度
往期回顾 全部

科技要闻

谷歌承认:AI模型“黑”进3家公司

头条要闻

中国男篮铜牌战不敌伊朗男篮 创下12年来最差亚运战绩

头条要闻

中国男篮铜牌战不敌伊朗男篮 创下12年来最差亚运战绩

体育要闻

2026亚运会开幕式 胡明轩吴愉担任旗手

娱乐要闻

许嵩刚官宣结婚,冯禧黑历史就被扒

财经要闻

民企土地 被政府"无偿收储"后转手卖7亿

汽车要闻

FREELANDER神行者8开启交付 首批新车正式交付用户

态度原创

手机
旅游
游戏
亲子
艺术

手机要闻

vivo X500拍照怎么样 8K Live图拍照首选机型

旅游要闻

光影节黄浦重磅新玩法!和夜鹭一起垂钓,还能玩转130米电信大楼!

《漫威金刚狼》开发者称结局为变种人后续铺路

亲子要闻

十件事看透孩子的心理!

艺术要闻

亚洲最大!武汉图书馆新馆亮灯,耗资18亿

无障碍浏览 进入关怀版