网易首页 > 网易号 > 正文 申请入驻

Agent 走向具身世界:从语言智能到机器人「大脑指挥官」

0
分享至


RoboHarness用编排异构策略,让VLA、WAM、RL和TAMP不再各说各话,并零样本完成长时序任务。

作者丨邓哲敏

编辑丨齐铖湧

想象这样一个任务:打开柜门,找到藏在里面的积木,然后把它们搭成一座桥。

对人来说,这是一件很简单的事,几个动作自然衔接,幼儿园小朋友也能顺利完成。

但对机器人来说,这个任务横跨多种完全不同的能力:找积木,需要视觉理解和语言指令跟随;开柜门,需要与环境进行复杂交互;搭积木,需要几何规划和精准操控并推测环境变化。

更麻烦的是,这些种能力分属多个不同“门派”的模型——VLA(视觉-语言-动作模型)、WAM(世界-动作模型)、RL 策略(强化学习)、TAMP(任务与运动规划)。它们各有所长,又彼此割裂,训练方式不同、输入格式不同、状态空间也不同。

今天在机器人领域,能力不缺,但协作缺位。

华为诺亚方舟实验室近期发布了一篇论文,提出了名为 RoboHarness 的系统,专门解决不同策略之间无法协作的问题。围绕这项工作,论文作者与我们进行了交流。


论文:https://arxiv.org/abs/2607.18060

项目主页:https://www.robo-harness.com/

01


万能模型的幻觉和现实的鸿沟

今年夏天,机器人研究领域密集出现了几项围绕 Harness 展开的工作,它们共同指向一个认知:靠更大的模型解决一切,暂时行不通,机器人需要一层执行组织系统。

清华大学于超教授团队在 7 月发布了 Harness VLA,将数字智能中广泛使用的 Harness Layer 引入具身智能,让一个冻结的 VLA 专注于最擅长的接触密集操控,同时用一层 Harness 学会何时、以何种方式调用它,以及在 VLA 失败后如何重置、如何重试。在 LIBERO-Pro 扰动评测中,这套系统把成功率从 50% 提升到 82.4%。

思路上,Harness VLA 解决的是一个模型如何在分布外扰动下稳定发挥。它的问题是单策略的稳定性。

华为诺亚方舟实验室的 RoboHarness,面对的是另一层问题:当任务超出任何一个模型的能力边界时,怎么办?

两者都叫 Harness,都用 Coding Agent 做组织层,但解决的是不同维度的挑战。前者让一个专才变得更稳,后者让一群各有所长的专才协同作战。随着机器人任务复杂度不断上升,后一个问题正变得越来越无法回避。

这个问题的根源,要从各路模型的能力边界说起。

VLA 模型的优势在于理解开放式语言指令、在新环境里泛化,但它端到端生成动作的方式,在长时序任务中很难保持一致性;强化学习策略能在特定训练场景内磨出稳定的闭环行为,但这种稳定性高度依赖训练分布,环境稍有变化便可能失效;TAMP 擅长符号推理和几何约束,但需要预先定义动作原语,面对开放场景和模糊目标时规划器很快就会吃力;WAM 能通过预测未来状态辅助长时序决策,但容易随预测时域增长产生误差累积。

复杂的真实任务同时要求语义理解、几何规划、闭环控制、长时序推理和环境变化推测,这些能力对应的训练目标不同,有时甚至相互冲突。从各项能力分别取得突破,到单一模型在开放环境里长期稳定兼顾所有能力,横亘着一道至今没有被真正跨越的鸿沟。

RoboHarness 的出发点正是:与其等待这道鸿沟被填平,不如先让已经存在、各有所长的模型真正协同起来。作者认为,直到某一个模型能够完全压制其他所有模型、展现出绝对的统治力之前,这样的编排架构都是非常有意义的。

这项工作并非凭空而来。作者告诉我们,RoboHarness 的雏形诞生于去年参加全球机器人挑战赛 BEHAVIOR Challenge 的经历。当时赛题任务又长又难,团队发现无论是端到端训练 VLA 还是用行为克隆之类的模型,都没法覆盖任务本身的难度。这次受挫,反而让团队看清了真正的问题所在。

02


调度大脑如何决定该谁上场

RoboHarness 的核心思路,是把 VLA、WAM、RL 策略、TAMP 等独立开发的控制系统,封装成可以被统一调度的 agentic skills,由 Coding Agent 负责高层决策。

这个设计有一个重要前提:不改变、不重训任何底层策略。各个策略保留自己的原始实现,不需要共享模型结构、动作空间或训练数据。RoboHarness 只是在它们之上增加了一层组织能力。

选对策略,可没那么容易。

对于一个 Coding Agent 来说,单靠原始图像输入,很难可靠地判断这个任务该派发给谁。因为这个决定背后藏着很多靠语言模型的语义理解能力答不出来的量化问题。它能读懂把杯子放到盘子上,但无法从一张 RGB 图像里算出当前场景与某个策略训练分布的相似度,更没法评估此刻传感器数据的可靠程度。

为了解决这个问题,系统设计了三类辅助技能,专门替 Coding Agent 把判断所需的信息提炼出来。


Understanding Skills,负责将原始输入转化为可量化的信号,比如:图像嵌入与各策略训练数据的相似度、物体位姿在时间窗口内的稳定性、当前光照和图像质量是否达标等。这些指标是策略路由的真正依据。作者认为,这个模块的本质,就是从多维度去衡量每一个策略到底适不适合当下的任务。

Memory Skills,检索历史执行经验,为选策略提供参照,并通过 Memory Bridge 处理策略之间的状态分布不匹配——这是系统最核心的设计,下文单独展开。

Evolution Skills,利用在线反馈持续更新策略的元数据和编排逻辑,让系统从每一次执行中学习,而不是每次面对新情况都从零判断。

三类技能的信息流相互交互,共同辅助 Coding Agent 决策。在实际执行中,这套机制主要有两层作用:一是任务拆解,将长指令切分为适合不同策略承接的子任务;二是动态切换,当当前策略逐渐接近其能力边界时,系统会及时切换到更合适的策略,实现不同策略之间的能力互补。

论文用一组消融实验说明了这两层的各自贡献:仅用语言模型帮 pi0.5 拆解任务再发给它,成功率已经明显上升;在此基础上接入多个异构策略后,成功率进一步大幅提升。拆得对是第一步,派得准是第二步,两者缺一不可。

但还有第三个问题,也是最难的一个,是光靠选策略解决不了的。

03


决定接力跑胜利的是交接的瞬间

两个独立训练的策略,通常生活在各自的数据世界里。它们的输入格式不同,对机器人状态的经验分布也不同。TAMP 操作完毕停下来的那个位置,很可能恰好落在 VLA 从未处理过、无法稳定启动的状态空间里。

这是异构策略编排独有的难题。

因此,负责让两个策略稳定交接的 Memory Bridge 被作者列为 RoboHarness 里第一重要的模块。他坦承,如果未来某个通用模型能完美覆盖全部状态空间,Memory Bridge 或许就非必需;但在现状下,任何模型都很容易在交接瞬间落进能力分布之外。


Memory Bridge 的工作分三步。

检索:根据下一子任务和当前观测,通过文本和视觉相似度,从多模态记忆库里找出目标策略曾经成功执行的 Top-K 条相似轨迹,提取末端执行器位姿、关节角度等机器人状态。

建模:根据各状态在轨迹中的相对进程赋予监督信号,通过在线回归实时拟合目标策略“习惯接手”的状态范围。

桥接:采样并评分候选状态,综合考虑进入目标策略舒适区的置信度和运动代价,选出最合适的桥接目标,生成过渡轨迹;机器人抵达这个状态后,再把控制权交给下一个策略。

这套机制完全依赖历史执行数据在线学习,对任意策略即插即用,无需修改底层实现,也不需要联合训练。

消融实验中,移除 Memory Bridge 后,任务进度下降不算太大,说明策略选择依然基本正确,但完整成功率从 86.0% 骤降至 60.4%。大量任务走到最后一步,因为交接状态不兼容而功败垂成,从方面证明了 Memory Bridge 的价值。

04


两条技术谱系,一场悄悄发生的汇流

把视野从这篇论文拉开,我们更想去描述一幅更大的具身技术版图。

RoboHarness 的作者观察到,在过去三年 VLA 快速发展的背景下,传统 TAMP 与分层规划由于在开放场景中的泛化能力明显弱于端到端 VLA,一度淡出社区关注。然而,随着今年 agentic systems 和 coding agents 的快速进展,分层架构重新获得了新的生命力:高层 agent 可以借助可组合的 skills 进行任务拆解、工具调用与动态规划,从而显著增强传统层级方法的泛化能力与适应性。由此,学术社区正重新关注,并开始探索如何将强泛化的高层推理与异构底层策略相结合。

这篇文章的作者来自多所加拿大东部高校和研究机构。笔者观察到,北美机器人研究长期存在两条具有明显学术渊源的技术路线:美国西海岸,以 Stanford、Berkeley 等为代表,更强调 learning 与 scaling,关注端到端学习、数据规模和模型泛化;而美国东北部及加拿大,以 MIT、多伦多大学、MILA 等为代表,则长期更重视分层架构、符号推理、逻辑规划和结构化决策。

RoboHarness 的作者们,正处于后者这条谱系的延伸之上。

技术路线的分化,在具身智能工业界留同样下了清晰印记。近年来快速发展的团队逐渐形成了从foundation model scaling 到 agentic hierarchy的技术谱系:一类更强调通用具身基础模型、VLA 与 world model,通过统一模型、数据规模与模型能力的提升不断拓展泛化边界;另一类则更强调可复用操作技能与分层架构,通过任务规划、技能组合和底层控制协同完成复杂任务。国内以智源为代表的团队更接近前者,而苏度科技、魔法原子等则更突出后者;在海外,Physical Intelligence 的 pi 系列长期代表了 scaling 路线,而 Gemini Robotics,则延续了“高层推理与规划 + 底层技能执行”的分层传统。

有意思的是,这种技术谱系的分化并非静态对立,而是在不断演化中形成互补。近几个月,两条技术路线开始出现明显的汇流现象。例如,Physical Intelligence 在 pi0.7 中将可控性与技能组合提升到更核心的位置;与此同时,NVIDIA 等团队也持续推出更具分层特征的 robot agentic systems,将基础模型的理解与推理能力与VLA结合。整体来看,foundation model scaling 与 agentic hierarchy 正在从两条相对独立的技术路径,逐渐演化为同一套机器人系统中的互补能力。

05


以编排为径,走向更通用的智能

RoboHarness 本身有明确的局限:它能调度的是已有策略,无法解决所有策略都做不到的事。Memory Bridge 的可靠性依赖足够的历史执行数据,新接入的策略在早期阶段的能力评估会有较大的不确定性。

论文的核心论点并非否定统一大模型的必要性。

作者强调,长时序任务的编排不仅是对现有能力的组合,本身也会持续产生单个模型难以独立获得的跨能力、跨场景执行数据。这类数据记录了不同策略之间的切换、衔接、失败恢复与协同过程,恰恰可能成为训练下一代通用机器人模型的重要来源。基于这一思路,RoboHarness 团队也正在探索将混合策略编排与执行过程中产生的数据重新用于底层策略训练,异构编排的执行经验进一步反哺模型基础能力的提升。

从寻找最强模型到组织最合适的能力,具身智能的竞争,正在悄悄延伸到系统层面的设计。异构策略编排与统一大模型,像是沿着两条不同山脊展开的跋涉,最终都指向同一个远方:让机器人拥有更通用、更可靠的智能。

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
我今年60岁,通过观察发现,寿命长的人走路一般有4个特征

我今年60岁,通过观察发现,寿命长的人走路一般有4个特征

蝉吟槐蕊
2026-08-18 13:11:31
成都九中旁16年老面馆要关了,有人从香港飞回来打卡|食饮密报

成都九中旁16年老面馆要关了,有人从香港飞回来打卡|食饮密报

花小猫的美食日常
2026-08-27 10:34:01
已报案!千万粉大V都被带节奏!"特斯拉FSD放弃中国、上海数据中心撤了"是谣言;

已报案!千万粉大V都被带节奏!"特斯拉FSD放弃中国、上海数据中心撤了"是谣言;

大白聊IT
2026-08-26 23:35:09
堪称最离谱的枕边翻车现场,清华学霸杨奇函被女友趁熟睡时蚂蚁搬家式转走百万

堪称最离谱的枕边翻车现场,清华学霸杨奇函被女友趁熟睡时蚂蚁搬家式转走百万

东方不败然多多
2026-08-22 04:34:50
川普想在欧洲和中东高悬达摩克利斯剑,然后开搞加拿大与印太战略

川普想在欧洲和中东高悬达摩克利斯剑,然后开搞加拿大与印太战略

邵旭峰域
2026-08-26 13:44:02
莫言:永远不要期望一个没有血缘关系的人,能站在你的角度替你考虑|成年人最大的清醒

莫言:永远不要期望一个没有血缘关系的人,能站在你的角度替你考虑|成年人最大的清醒

杏花烟雨江南的碧园
2026-07-27 11:15:03
许家印被判刑的3天内,家印高中、家印小学门头接连被拆,有人感叹人走茶凉,有人支持拆除,评论区吵翻天!

许家印被判刑的3天内,家印高中、家印小学门头接连被拆,有人感叹人走茶凉,有人支持拆除,评论区吵翻天!

谭谈社会
2026-08-23 10:24:18
一个贪财一个好色?许家印事出5天,不止丁玉梅被曝30岁白人男友

一个贪财一个好色?许家印事出5天,不止丁玉梅被曝30岁白人男友

墨印斋
2026-08-25 12:38:26
爸爸几年如一日给女儿发:“大肥猫发给我”,刚开始以为爸爸是猫瘾太重,结果没想到...知道真相后笑着哭了

爸爸几年如一日给女儿发:“大肥猫发给我”,刚开始以为爸爸是猫瘾太重,结果没想到...知道真相后笑着哭了

铲屎官阿伟
2026-08-26 10:15:10
套现146亿后跑路新加坡就能万事大吉?国家新规重拳出击:只要钱还在中国赚,拿了绿卡也照样得补税!申通前老板如意算盘,这下彻底落空了

套现146亿后跑路新加坡就能万事大吉?国家新规重拳出击:只要钱还在中国赚,拿了绿卡也照样得补税!申通前老板如意算盘,这下彻底落空了

人生录
2026-08-16 00:05:13
大陆已接到消息,郑丽文彻底暴露了,她在金门喊话赖清德做一件事

大陆已接到消息,郑丽文彻底暴露了,她在金门喊话赖清德做一件事

爱下厨的阿酾
2026-08-26 10:02:50
就在大家都以为中国会坚决回应时,北京却选择了战略克制。

就在大家都以为中国会坚决回应时,北京却选择了战略克制。

回京历史梦
2026-08-22 18:23:43
亚洲斯诺克里程碑,60年空白被填补,赵心童打破欧美斯诺克神话

亚洲斯诺克里程碑,60年空白被填补,赵心童打破欧美斯诺克神话

闻识
2026-06-06 18:01:08
拜占庭式破产:一个无耻帝国的千年闭环

拜占庭式破产:一个无耻帝国的千年闭环

冷炮历史
2026-08-25 13:02:12
场均丢接近 3 球,迈阿密防线崩盘,卡塞米罗到底错在哪

场均丢接近 3 球,迈阿密防线崩盘,卡塞米罗到底错在哪

艳儿说电影
2026-08-27 18:44:40
水利部长傅作义无实际职权,副部长代替签字,周总理:一律无效

水利部长傅作义无实际职权,副部长代替签字,周总理:一律无效

云霄纪史观
2026-08-06 14:12:27
朱一龙遭75岁老奶奶“灵魂追问”:你看起来文质彬彬、很有文化的,怎么演个土匪呢?

朱一龙遭75岁老奶奶“灵魂追问”:你看起来文质彬彬、很有文化的,怎么演个土匪呢?

草莓解说体育
2026-08-27 02:42:11
细思极恐!现社会6大伦理乱象,人心悄悄变坏,很多人却浑然不知

细思极恐!现社会6大伦理乱象,人心悄悄变坏,很多人却浑然不知

小鹿姐姐情感说
2026-08-15 10:37:55
梅德韦杰夫称俄还会拿更多的乌克兰领土,目前约20%已被俄控制

梅德韦杰夫称俄还会拿更多的乌克兰领土,目前约20%已被俄控制

桂系007
2026-08-23 04:57:40
中国空军突然亮剑!超200架战机升空,8大基地联动,释放强烈信号

中国空军突然亮剑!超200架战机升空,8大基地联动,释放强烈信号

林子说事
2026-08-26 11:28:47
2026-08-27 19:07:00
AI科技评论 incentive-icons
AI科技评论
点评学术,服务AI
7586文章数 20776关注度
往期回顾 全部

科技要闻

苹果邀请函:新CEO、折叠屏iPhone都要来了

头条要闻

西藏吉隆受灾前后对比图:建筑被淤泥覆盖 形成堰塞湖

头条要闻

西藏吉隆受灾前后对比图:建筑被淤泥覆盖 形成堰塞湖

体育要闻

因为这条规则,欧联冠军一个夏天散伙了

娱乐要闻

包贝尔幽会后陪老婆!曾炫耀谈7个女友

财经要闻

机构预测"过剩",市场却在疯抢废铜?

汽车要闻

领克900:心之所向皆可抵达 | 潮汕篇

态度原创

教育
旅游
亲子
健康
房产

教育要闻

专业风向真的变了!2026就业数据曝光:这些老工科正在悄悄翻身

旅游要闻

一览:尼泊尔失联游客都来自哪些国家?为何这么多?

亲子要闻

这些寄生虫美食,千万别让孩子碰!

突发脑梗怎么救命?一定看这两条路

房产要闻

落户江东!京东海南总部方案曝光!

无障碍浏览 进入关怀版