网易首页 > 网易号 > 正文 申请入驻

告别通用具身模型崇拜:具身智能走向异构策略编排

0
分享至



当 VLA、WAM、RL、TAMP、MPC 等机器人控制策略在各自擅长的任务中大放异彩,如何刻画其能力边界,并在正确的时机为不同子任务匹配最合适的策略,正逐渐成为机器人完成复杂长时序任务的关键。



  • 论文标题:RoboHarness: Memory-Driven Orchestration of Heterogeneous Robot Policies for Long-Horizon Planning
  • Project Page:https://robo-harness.com
  • arxiv link: https://arxiv.org/abs/2607.18060

具身智能正在经历模型能力竞赛:VLA 在 Scaling 的道路上一路狂奔,WAM 弥合未来预测和动作生成,RL 依靠 Reward Design 强化执行稳定性,TAMP 凭借严密的逻辑进行长序推理…

各个策略在擅长的任务上都有独特的优势,但真实世界往往同时要求高度的语义理解、闭环控制、几何精度、长时序推理,远远超出了单一控制策略的能力边界。仰望 “通用具身模型”,只能长叹:“道阻且长”。

RoboHarness: 没有最强的模型,只有最合适的策略。

为什么需要异构策略编排?

与其苦苦等待未来一个通用模型包办一切,不如问问:协同调用现有的控制策略,我们能做什么?

纵观具身智能技术历史长河上闪耀的星辰,VLA 擅长视觉语义理解与开放词汇指令,RL 在特定分布内具有稳定闭环行为,TAMP 擅长逻辑与几何规划,WAM 则通过预测未来辅助决策… 我们不难发现,它们的能力并非是彼此替代,而是在某些方向高度互补。

既然单一策略难以覆盖复杂任务的全部需求,为什么不让异构策略协同工作,在不同阶段各展所长?

从模型竞争,走向异构策略编排

RoboHarness 主要解决两个异构策略协同的关键难题: (1) 如何选择最适合的策略?(2) 异构策略间如何交接?它将 VLA、RL、TAMP 等控制策略封装为可调用技能,由 coding agent 进行高层任务拆解及子任务路由,并在相邻异构策略状态分布不兼容(Out of Distribution)时生成桥接轨迹。系统无需底层策略共享结构、动作空间或训练数据,也无需联合训练,可无痛接入新的底层控制策略,包括 WAM、VLN 或 MPC 等。



图 1|RoboHarness 总体框架。

RoboHarness 提供三类结构化辅助技能:Understanding Skills 调用一系列分析技能,从原始输入中提取更丰富的信息辅助决策;Memory Skills 检索相关的历史执行经验,显式重建下一控制策略熟悉的状态分布,并据此引导机器人进入该分布,实现不同策略之间的稳定交接;Evolution Skills 利用在线反馈更新策略元数据、参数与 Harness 逻辑。

第一步:识别策略的动态能力边界

策略能力边界并非固定不变,它受多种因素影响。VLA 在原始相机位姿下能够稳定执行的任务,在输入图片质量下降后可能会失败。系统需要判断,在当前场景、观测质量和机器人状态下,最有可能成功的控制策略是谁?RoboHarness 利用 Understanding Skills 从原始输入中,深入获取更丰富的信息(语义相似度、位姿不确定性、图像曝光等多维指标)刻画控制策略能力的边界,以辅助高层执行策略的选择。



图 2|不同扰动下的策略调用比例,以及 VLA 独立成功率与调用比例之间的关系。

表 1|LIBERO 与 LIBERO-Plus 成功率(%), RoboHarness 集成了pi0.5和 TAMP 两种底层策略



在 LIBERO-Plus 的多类扰动中,RoboHarness 会根据底层策略的实际可靠性调整调用比例:VLA 越稳定,系统越倾向于调用它;当机器人状态、语言或感知条件超出其能力边界时,则更多路由至 TAMP。RoboHarness 通过多策略协作,在 LIBERO-Plus 上取得 93.2% 的平均成功率,高于其余现有方法。

第二步:解决异构策略之间的 “交接断层”

两个策略之间常存在 “交接断层”:由于各控制策略独立设计,前一策略结束的位置,可能恰好是后一策略从未见过、无法稳定启动的状态。Memory Bridge 根据下一子任务和当前观测,从多模态记忆中检索下一目标策略的成功轨迹,提取末端位姿和关节状态,并在线拟合 “机器人状态 — 执行进程” 的空间分布,显式重建下一控制策略熟悉的状态分布。系统随后综合分布内置信度与运动代价选择目标状态,生成桥接轨迹,再将控制权交给下一策略



图 3|Memory Bridge 构造通路。

长时序任务揭示了单一模型的能力壁垒

长时序任务最能暴露单一策略的能力壁垒。在约为原始 LIBERO 四倍长度的 LIBERO-LoHo 上零样本测试,π0.5 完整成功率仅 6.4%; 即使通过世界模型(H-WM)、LLM(LLM-guided)或规划语言(Logic-guided)分层拆解任务,再交由 VLA 执行,完整成功率最高也仅为 64.8%。这证明了单一模型始终很难突破现有的能力壁垒, RoboHarness 通过协同调用多种底层控制策略并保证稳定交接,将完整成功率提升至 95.2%。

表 2|LIBERO-LoHo 零样本长时序评估。RoboHarness 集成三种底层策略:pi0.5、经 RL 训练的 OpenVLA 和 TAMP。各项结果为任务进度 / 完整成功率(%)。



准确刻画能力边界与实现策略间的稳定交接,

二者缺一不可。

消融实验表明,协同并非简单地将模型串联。缺少 Understanding Skills,系统会因无法准确理解各底层策略的能力边界而出现任务分解和路由错误;移除 Memory Bridge 后,即使选对策略,也可能因交接状态不兼容而失败;缺少 Evolution Skills,系统则难以根据执行反馈修正能力判断,并在线更新各策略的能力边界。理解、适应与交接,缺一不可。



图 4|消融实验:理解、进化与 Memory Bridge 分别解决错误分解、能力估计失准和策略交接失败。

具身智能的竞争,

正在从模型走向系统

“通用具身模型” 仍是所有具身人的终极目标,但在追逐的慢慢长路中,机器人必须正视每种策略的能力边界、输入依赖与分布外脆弱性。异构策略编排提供了一条现实路径:不要求单一模型立即掌握所有能力,而是让系统理解不同策略何时可靠、如何分工和交接。

RoboHarness 逐渐积累跨策略、长时序数据,反哺未来统一具身模型训练。

它不是通用模型的对立面,而是具身智能从模型能力走向系统能力的必由之路。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
陈璇半蹲采访和董卿跪地采访,同是弯腰为何一赞一骂?

陈璇半蹲采访和董卿跪地采访,同是弯腰为何一赞一骂?

不掉线电波
2026-08-03 23:02:58
国家邮政局依法对申通快递立案调查 申通回应:立行立改、全力配合各项调查

国家邮政局依法对申通快递立案调查 申通回应:立行立改、全力配合各项调查

每日经济新闻
2026-08-04 19:36:03
特朗普家族入局估值200亿美元FIFA新公司,欧洲足坛愤怒“绞杀”因凡蒂诺

特朗普家族入局估值200亿美元FIFA新公司,欧洲足坛愤怒“绞杀”因凡蒂诺

红星新闻
2026-08-04 17:12:27
对待“叛徒”,中日韩三国网民达成了共识

对待“叛徒”,中日韩三国网民达成了共识

补壹刀
2026-08-04 11:14:43
“妈妈,你是否也打听过我?”搬瓜少年一篇《我的妈妈》看哭全网:因学费昂贵放弃上体校,准备读职高,视频爆火后仍半夜搬水泥挣钱

“妈妈,你是否也打听过我?”搬瓜少年一篇《我的妈妈》看哭全网:因学费昂贵放弃上体校,准备读职高,视频爆火后仍半夜搬水泥挣钱

三湘都市报
2026-08-03 20:43:39
U17国足两连胜!完胜毕巴,程晟涵连场破门,赵松源中柱

U17国足两连胜!完胜毕巴,程晟涵连场破门,赵松源中柱

奥拜尔
2026-08-04 17:59:13
67岁英国大妈飞机上心脏病发,现场却同时出现15位心脏专家!死神:我不要脸的吗?

67岁英国大妈飞机上心脏病发,现场却同时出现15位心脏专家!死神:我不要脸的吗?

英国那些事儿
2026-08-04 00:10:18
北京一车主送修千万超跑被工作人员私自拍照打卡,品牌售后方称已致歉

北京一车主送修千万超跑被工作人员私自拍照打卡,品牌售后方称已致歉

上游新闻
2026-08-04 15:03:18
惊险!上海飞东京航班临近降落时险些与飞行检查飞机相撞,高度仅差20米,机上共197人

惊险!上海飞东京航班临近降落时险些与飞行检查飞机相撞,高度仅差20米,机上共197人

扬子晚报
2026-08-04 12:41:57
宁波砸伤瓜摊主案:赔偿账单竟有多离谱?协商进展为何卡“零”?

宁波砸伤瓜摊主案:赔偿账单竟有多离谱?协商进展为何卡“零”?

社会日日鲜
2026-08-03 10:27:17
乌克兰宣布对俄“40天影响行动”无限续期,7月两国对轰数据均创纪录

乌克兰宣布对俄“40天影响行动”无限续期,7月两国对轰数据均创纪录

红星新闻
2026-08-04 18:28:44
项立刚力挺华为!怒斥“竹知了”是有组织的炒作,本想吃华为饭,结果被网友扒老底,评论区清一色谩骂!

项立刚力挺华为!怒斥“竹知了”是有组织的炒作,本想吃华为饭,结果被网友扒老底,评论区清一色谩骂!

谭谈社会
2026-08-04 13:16:49
税收4亿,工资26亿:财政没钱,为什么编内待遇不能动?

税收4亿,工资26亿:财政没钱,为什么编内待遇不能动?

混沌录
2026-07-23 17:11:06
消息人士披露美拟关闭一批使领馆 涉及加、日等国

消息人士披露美拟关闭一批使领馆 涉及加、日等国

新华社
2026-08-04 16:23:13
主持人陈璇下蹲采访老外后续!账号变私密,老公与女儿照片被扒

主持人陈璇下蹲采访老外后续!账号变私密,老公与女儿照片被扒

180视角
2026-08-04 09:34:14
女主持人回应与蔡崇信合照,否认两人系情侣关系:一张正常清白的合照被曲解成不正常关系,非常诧异;此前蔡崇信与妻子官宣离婚

女主持人回应与蔡崇信合照,否认两人系情侣关系:一张正常清白的合照被曲解成不正常关系,非常诧异;此前蔡崇信与妻子官宣离婚

扬子晚报
2026-08-04 12:39:36
同济大学取消长期聘任,不分新人老人,3 年一考核 6 年一大考,网友:别没赶走摸鱼的,先吓跑高产学者

同济大学取消长期聘任,不分新人老人,3 年一考核 6 年一大考,网友:别没赶走摸鱼的,先吓跑高产学者

生物学霸
2026-08-04 17:38:27
男性延至68岁,女性延至63岁!多地发文

男性延至68岁,女性延至63岁!多地发文

阜阳发布
2026-08-04 16:22:21
国家邮政局依法对申通快递有限公司立案调查

国家邮政局依法对申通快递有限公司立案调查

界面新闻
2026-08-04 19:06:35
杜兰特怒怼詹迷:你们老急,因为我抢走两个冠军影响他的GOAT履历

杜兰特怒怼詹迷:你们老急,因为我抢走两个冠军影响他的GOAT履历

懂球帝
2026-08-04 16:14:33
2026-08-04 20:20:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13673文章数 142710关注度
往期回顾 全部

科技要闻

Anthropic老板急了:挖来的人,可能只为钱

头条要闻

执行局长骚扰女当事人被停职 所在法院刚开完警示大会

头条要闻

执行局长骚扰女当事人被停职 所在法院刚开完警示大会

体育要闻

斯卢茨基告别申花:1座城市和14亿份难忘的回忆

娱乐要闻

李荣浩《小眼睛》被指抄袭,撤销署名

财经要闻

英伟达量产CPO,A股龙头溢价时代到来

汽车要闻

方程S系列将于成都车展发布内饰 9月上旬新车上市即交付

态度原创

游戏
亲子
本地
旅游
公开课

双平台玩家血赚!《博德之门3》加入XPA

亲子要闻

这样养育孩子,他未来想不成功都难!

本地新闻

课本里的童年,绍兴正上演

旅游要闻

安徽一景区为自驾漂流车主报销高速过路费

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版