网易首页 > 网易号 > 正文 申请入驻

Agent 走向具身世界:从语言智能到机器人「大脑指挥官」

0
分享至


RoboHarness用编排异构策略,让VLA、WAM、RL和TAMP不再各说各话,并零样本完成长时序任务。

作者丨邓哲敏

编辑丨齐铖湧

想象这样一个任务:打开柜门,找到藏在里面的积木,然后把它们搭成一座桥。

对人来说,这是一件很简单的事,几个动作自然衔接,幼儿园小朋友也能顺利完成。

但对机器人来说,这个任务横跨多种完全不同的能力:找积木,需要视觉理解和语言指令跟随;开柜门,需要与环境进行复杂交互;搭积木,需要几何规划和精准操控并推测环境变化。

更麻烦的是,这些种能力分属多个不同“门派”的模型——VLA(视觉-语言-动作模型)、WAM(世界-动作模型)、RL 策略(强化学习)、TAMP(任务与运动规划)。它们各有所长,又彼此割裂,训练方式不同、输入格式不同、状态空间也不同。

今天在机器人领域,能力不缺,但协作缺位。

华为诺亚方舟实验室近期发布了一篇论文,提出了名为 RoboHarness 的系统,专门解决不同策略之间无法协作的问题。围绕这项工作,论文作者与我们(雷峰网)进行了交流。


论文:https://arxiv.org/abs/2607.18060

项目主页:https://www.robo-harness.com/


01

万能模型的幻觉和现实的鸿沟

今年夏天,机器人研究领域密集出现了几项围绕 Harness 展开的工作,它们共同指向一个认知:靠更大的模型解决一切,暂时行不通,机器人需要一层执行组织系统。

清华大学于超教授团队在 7 月发布了 Harness VLA,将数字智能中广泛使用的 Harness Layer 引入具身智能,让一个冻结的 VLA 专注于最擅长的接触密集操控,同时用一层 Harness 学会何时、以何种方式调用它,以及在 VLA 失败后如何重置、如何重试。在 LIBERO-Pro 扰动评测中,这套系统把成功率从 50% 提升到 82.4%。

思路上,Harness VLA 解决的是一个模型如何在分布外扰动下稳定发挥。它的问题是单策略的稳定性。

华为诺亚方舟实验室的 RoboHarness,面对的是另一层问题:当任务超出任何一个模型的能力边界时,怎么办?

两者都叫 Harness,都用 Coding Agent 做组织层,但解决的是不同维度的挑战。前者让一个专才变得更稳,后者让一群各有所长的专才协同作战。随着机器人任务复杂度不断上升,后一个问题正变得越来越无法回避。

这个问题的根源,要从各路模型的能力边界说起。

VLA 模型的优势在于理解开放式语言指令、在新环境里泛化,但它端到端生成动作的方式,在长时序任务中很难保持一致性;强化学习策略能在特定训练场景内磨出稳定的闭环行为,但这种稳定性高度依赖训练分布,环境稍有变化便可能失效;TAMP 擅长符号推理和几何约束,但需要预先定义动作原语,面对开放场景和模糊目标时规划器很快就会吃力;WAM 能通过预测未来状态辅助长时序决策,但容易随预测时域增长产生误差累积。

复杂的真实任务同时要求语义理解、几何规划、闭环控制、长时序推理和环境变化推测,这些能力对应的训练目标不同,有时甚至相互冲突。从各项能力分别取得突破,到单一模型在开放环境里长期稳定兼顾所有能力,横亘着一道至今没有被真正跨越的鸿沟。

RoboHarness 的出发点正是:与其等待这道鸿沟被填平,不如先让已经存在、各有所长的模型真正协同起来。作者认为,直到某一个模型能够完全压制其他所有模型、展现出绝对的统治力之前,这样的编排架构都是非常有意义的。

这项工作并非凭空而来。作者告诉我们(雷峰网),RoboHarness 的雏形诞生于去年参加全球机器人挑战赛 BEHAVIOR Challenge 的经历。当时赛题任务又长又难,团队发现无论是端到端训练 VLA 还是用行为克隆之类的模型,都没法覆盖任务本身的难度。这次受挫,反而让团队看清了真正的问题所在。


02

调度大脑如何决定该谁上场

RoboHarness 的核心思路,是把 VLA、WAM、RL 策略、TAMP 等独立开发的控制系统,封装成可以被统一调度的 agentic skills,由 Coding Agent 负责高层决策。

这个设计有一个重要前提:不改变、不重训任何底层策略。各个策略保留自己的原始实现,不需要共享模型结构、动作空间或训练数据。RoboHarness 只是在它们之上增加了一层组织能力。

选对策略,可没那么容易。

对于一个 Coding Agent 来说,单靠原始图像输入,很难可靠地判断这个任务该派发给谁。因为这个决定背后藏着很多靠语言模型的语义理解能力答不出来的量化问题。它能读懂把杯子放到盘子上,但无法从一张 RGB 图像里算出当前场景与某个策略训练分布的相似度,更没法评估此刻传感器数据的可靠程度。

为了解决这个问题,系统设计了三类辅助技能,专门替 Coding Agent 把判断所需的信息提炼出来。


Understanding Skills,负责将原始输入转化为可量化的信号,比如:图像嵌入与各策略训练数据的相似度、物体位姿在时间窗口内的稳定性、当前光照和图像质量是否达标等。这些指标是策略路由的真正依据。作者认为,这个模块的本质,就是从多维度去衡量每一个策略到底适不适合当下的任务。

Memory Skills,检索历史执行经验,为选策略提供参照,并通过 Memory Bridge 处理策略之间的状态分布不匹配——这是系统最核心的设计,下文单独展开。

Evolution Skills,利用在线反馈持续更新策略的元数据和编排逻辑,让系统从每一次执行中学习,而不是每次面对新情况都从零判断。

三类技能的信息流相互交互,共同辅助 Coding Agent 决策。在实际执行中,这套机制主要有两层作用:一是任务拆解,将长指令切分为适合不同策略承接的子任务;二是动态切换,当当前策略逐渐接近其能力边界时,系统会及时切换到更合适的策略,实现不同策略之间的能力互补。

论文用一组消融实验说明了这两层的各自贡献:仅用语言模型帮 pi0.5 拆解任务再发给它,成功率已经明显上升;在此基础上接入多个异构策略后,成功率进一步大幅提升。拆得对是第一步,派得准是第二步,两者缺一不可。

但还有第三个问题,也是最难的一个,是光靠选策略解决不了的。


03

决定接力跑胜利的是交接的瞬间

两个独立训练的策略,通常生活在各自的数据世界里。它们的输入格式不同,对机器人状态的经验分布也不同。TAMP 操作完毕停下来的那个位置,很可能恰好落在 VLA 从未处理过、无法稳定启动的状态空间里。

这是异构策略编排独有的难题。

因此,负责让两个策略稳定交接的 Memory Bridge 被作者列为 RoboHarness 里第一重要的模块。他坦承,如果未来某个通用模型能完美覆盖全部状态空间,Memory Bridge 或许就非必需;但在现状下,任何模型都很容易在交接瞬间落进能力分布之外。


Memory Bridge 的工作分三步。

检索:根据下一子任务和当前观测,通过文本和视觉相似度,从多模态记忆库里找出目标策略曾经成功执行的 Top-K 条相似轨迹,提取末端执行器位姿、关节角度等机器人状态。

建模:根据各状态在轨迹中的相对进程赋予监督信号,通过在线回归实时拟合目标策略“习惯接手”的状态范围。

桥接:采样并评分候选状态,综合考虑进入目标策略舒适区的置信度和运动代价,选出最合适的桥接目标,生成过渡轨迹;机器人抵达这个状态后,再把控制权交给下一个策略。

这套机制完全依赖历史执行数据在线学习,对任意策略即插即用,无需修改底层实现,也不需要联合训练。

消融实验中,移除 Memory Bridge 后,任务进度下降不算太大,说明策略选择依然基本正确,但完整成功率从 86.0% 骤降至 60.4%。大量任务走到最后一步,因为交接状态不兼容而功败垂成,从方面证明了 Memory Bridge 的价值。


04

两条技术谱系,一场悄悄发生的汇流

把视野从这篇论文拉开,我们更想去描述一幅更大的具身技术版图。

RoboHarness 的作者观察到,在过去三年 VLA 快速发展的背景下,传统 TAMP 与分层规划由于在开放场景中的泛化能力明显弱于端到端 VLA,一度淡出社区关注。然而,随着今年 agentic systems 和 coding agents 的快速进展,分层架构重新获得了新的生命力:高层 agent 可以借助可组合的 skills 进行任务拆解、工具调用与动态规划,从而显著增强传统层级方法的泛化能力与适应性。由此,学术社区正重新关注,并开始探索如何将强泛化的高层推理与异构底层策略相结合。

这篇文章的作者来自多所加拿大东部高校和研究机构。笔者观察到,北美机器人研究长期存在两条具有明显学术渊源的技术路线:美国西海岸,以 Stanford、Berkeley 等为代表,更强调 learning 与 scaling,关注端到端学习、数据规模和模型泛化;而美国东北部及加拿大,以 MIT、多伦多大学、MILA 等为代表,则长期更重视分层架构、符号推理、逻辑规划和结构化决策。

RoboHarness 的作者们,正处于后者这条谱系的延伸之上。

技术路线的分化,在具身智能工业界留同样下了清晰印记。近年来快速发展的团队逐渐形成了从foundation model scaling 到 agentic hierarchy的技术谱系:一类更强调通用具身基础模型、VLA 与 world model,通过统一模型、数据规模与模型能力的提升不断拓展泛化边界;另一类则更强调可复用操作技能与分层架构,通过任务规划、技能组合和底层控制协同完成复杂任务。国内以智源为代表的团队更接近前者,而苏度科技、魔法原子等则更突出后者;在海外,Physical Intelligence 的 pi 系列长期代表了 scaling 路线,而 Gemini Robotics,则延续了“高层推理与规划 + 底层技能执行”的分层传统。

有意思的是,这种技术谱系的分化并非静态对立,而是在不断演化中形成互补。近几个月,两条技术路线开始出现明显的汇流现象。例如,Physical Intelligence 在 pi0.7 中将可控性与技能组合提升到更核心的位置;与此同时,NVIDIA 等团队也持续推出更具分层特征的 robot agentic systems,将基础模型的理解与推理能力与VLA结合。整体来看,foundation model scaling 与 agentic hierarchy 正在从两条相对独立的技术路径,逐渐演化为同一套机器人系统中的互补能力。


05

以编排为径,走向更通用的智能

RoboHarness 本身有明确的局限:它能调度的是已有策略,无法解决所有策略都做不到的事。Memory Bridge 的可靠性依赖足够的历史执行数据,新接入的策略在早期阶段的能力评估会有较大的不确定性。

论文的核心论点并非否定统一大模型的必要性。

作者强调,长时序任务的编排不仅是对现有能力的组合,本身也会持续产生单个模型难以独立获得的跨能力、跨场景执行数据。这类数据记录了不同策略之间的切换、衔接、失败恢复与协同过程,恰恰可能成为训练下一代通用机器人模型的重要来源。基于这一思路,RoboHarness 团队也正在探索将混合策略编排与执行过程中产生的数据重新用于底层策略训练,异构编排的执行经验进一步反哺模型基础能力的提升。

从寻找最强模型到组织最合适的能力,具身智能的竞争,正在悄悄延伸到系统层面的设计。异构策略编排与统一大模型,像是沿着两条不同山脊展开的跋涉,最终都指向同一个远方:让机器人拥有更通用、更可靠的智能。

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
“中午11点18分突发巨响”,江苏一地销毁烟花爆炸,隔壁市570多户家墙裂玻璃碎

“中午11点18分突发巨响”,江苏一地销毁烟花爆炸,隔壁市570多户家墙裂玻璃碎

黄河新闻网吕梁
2026-08-27 15:33:29
看了胡军才知道,最高级的炫富是刻在骨子里的边界感

看了胡军才知道,最高级的炫富是刻在骨子里的边界感

娱乐圈十三太保
2026-08-26 15:56:43
25岁赴韩中国女留学生已确认遇害,熟人作案,凶手身份曝光难以置信

25岁赴韩中国女留学生已确认遇害,熟人作案,凶手身份曝光难以置信

小徐讲八卦
2026-08-26 10:33:47
“洗衣凝珠”为何突然没人用了?看完这些缺点,我果断换回洗衣粉

“洗衣凝珠”为何突然没人用了?看完这些缺点,我果断换回洗衣粉

家居设计师苏哥
2026-08-26 15:01:46
多名院士调查发现:吃一口久放至黑斑的香蕉,或等于进一次毒?

多名院士调查发现:吃一口久放至黑斑的香蕉,或等于进一次毒?

阿兵科普
2026-08-26 10:45:41
丰田新车官宣:8月26日 ,正式上市

丰田新车官宣:8月26日 ,正式上市

科技堡垒
2026-08-26 11:23:57
狼狈一局!日本女排大半局处于落后,让台北得21分,半决赛泰国可爆冷?

狼狈一局!日本女排大半局处于落后,让台北得21分,半决赛泰国可爆冷?

南海浪花
2026-08-27 20:45:16
第一次感受到了风油精的“洪荒之力”,几块钱一瓶,能解决这么多事

第一次感受到了风油精的“洪荒之力”,几块钱一瓶,能解决这么多事

抠搜侠
2026-08-07 13:59:21
预估25万左右!凯迪拉克新车曝光:9月7日正式上市

预估25万左右!凯迪拉克新车曝光:9月7日正式上市

科技阿维
2026-08-27 10:41:18
“一个月陪睡一两次”:网红魏莹的榜一大哥照片曝光,他身价过亿,是个大企业家

“一个月陪睡一两次”:网红魏莹的榜一大哥照片曝光,他身价过亿,是个大企业家

江山挥笔
2026-08-25 16:40:36
中国男篮战卡塔尔12人名单出炉!杨瀚森胡金秋领衔

中国男篮战卡塔尔12人名单出炉!杨瀚森胡金秋领衔

体坛周报
2026-08-27 08:29:23
很难再有新增地铁城市了

很难再有新增地铁城市了

环球通信
2026-08-26 21:38:10
为啥男的死后用“考”,女的用“妣”?分别代表啥意思?答案来了

为啥男的死后用“考”,女的用“妣”?分别代表啥意思?答案来了

千秋文化
2026-08-24 20:15:00
全网一致看衰宇树科技,可能是这两年互联网最难得的共识!

全网一致看衰宇树科技,可能是这两年互联网最难得的共识!

人间运行手册
2026-08-26 14:12:47
43岁刘翔再怼上海体育局:这10年是你没让我走!让我执教是毁人前途

43岁刘翔再怼上海体育局:这10年是你没让我走!让我执教是毁人前途

我爱英超
2026-08-27 00:53:38
单日伤亡1400人?顿巴斯变成血腥绞肉机,俄军取胜计划全盘落空

单日伤亡1400人?顿巴斯变成血腥绞肉机,俄军取胜计划全盘落空

你是我心中最美星空
2026-08-26 08:12:21
白宫发了一张图,全世界哭笑不得

白宫发了一张图,全世界哭笑不得

牛弹琴
2026-08-27 07:58:02
日本代表团抵达北京,一待就是4天,高市11月来华,中方斩钉截铁

日本代表团抵达北京,一待就是4天,高市11月来华,中方斩钉截铁

临云史策
2026-08-26 13:41:15
大开眼界!许家印当年奢靡生活曝光

大开眼界!许家印当年奢靡生活曝光

麦杰逊
2026-08-23 15:09:25
750万电驴吞噬城市:深圳败笔不是乱停,是人行道变成夺命赛道!

750万电驴吞噬城市:深圳败笔不是乱停,是人行道变成夺命赛道!

你在偷看谁
2026-08-27 20:42:00
2026-08-27 23:32:49
雷峰网 incentive-icons
雷峰网
关注智能与未来!
70697文章数 656216关注度
往期回顾 全部

科技要闻

苹果邀请函:新CEO、折叠屏iPhone都要来了

头条要闻

亚朵起诉重庆"朵雅酒店"商标侵权 开庭前一天撤诉

头条要闻

亚朵起诉重庆"朵雅酒店"商标侵权 开庭前一天撤诉

体育要闻

因为这条规则,欧联冠军一个夏天散伙了

娱乐要闻

包贝尔幽会后陪老婆!曾炫耀谈7个女友

财经要闻

机构预测"过剩",市场却在疯抢废铜?

汽车要闻

领克900:心之所向皆可抵达 | 潮汕篇

态度原创

房产
教育
本地
家居
公开课

房产要闻

落户江东!京东海南总部方案曝光!

教育要闻

孩子休学在家摆烂,不全是由父母决定的!

本地新闻

无印良品竟是桐乡造?这座小城藏着一个刀具帝国

家居要闻

2026建博会(广州) 公装联探展交流活动

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版