网易首页 > 网易号 > 正文 申请入驻

ECCV 2026|不靠「上帝视角」,也不等「完美指令」:REAL 让具身智能体走向开放世界

0
分享至



真实家庭任务往往从「不完整的信息」开始:机器人不知道目标在哪里,用户也未必能一次说清自己想要什么。面对「帮我从餐桌上拿点零食」这样的模糊指令,机器人不仅要主动寻找候选物体,还要在发现面包和多个甜甜圈后进一步询问用户,确认究竟该拿哪一个。

在真实世界里,探索环境、理解意图和执行动作,本就不是三个彼此独立的问题。

围绕这一问题,来自上海交通大学、上海人工智能实验室等机构的研究者提出REAL,一个面向开放世界移动操作的可探索、可交互、可部署的视觉具身智能体框架,并构建了贯穿仿真、数据生成、模型训练、系统评测与真机部署的完整技术链路。这篇工作已被ECCV 2026接收。



视频链接:https://mp.weixin.qq.com/s/73eYUk46YQTXvQxI29vadw

论文链接:https://arxiv.org/abs/2607.13653

️ 项目主页:https://internrobotics.github.io/REAL/

开源代码:https://github.com/InternRobotics/REAL

一、从仿真到真实世界:

没有「上帝视角」,也没有「完美指令」

面向从仿真到真实世界的迁移,REAL 重点针对现有具身智能体仿真环境中两项被过度理想化的假设:环境信息充分可知用户意图清晰明确。而在真实部署中,智能体往往面临相反的情况——环境未知,机器人缺乏先验感知;以及意图模糊,用户难以在任务开始时一次性明确需求。具体而言:

首先是环境状态信息缺失。现有仿真环境通常通过特权感知接口(oracle perception API)提供任务相关物体的数量、位置等真实信息,但在真实环境中这些信息无法被直接获取,智能体需要依靠主动探索发现物体。依赖特权信息训练得到的智能体,在真实部署中往往缺乏自主感知与探索能力。

其次是用户意图信息模糊。现有的具身智能体评测任务通常假定指令是清晰明确的,但真实场景下的用户未必知晓环境全貌,往往只能给出模糊需求,并根据智能体的反馈逐步细化任务。因此,真实环境下的智能体需要能反馈当前环境状态,并按照用户需求调整后续行为。

为应对这两类不确定性,REAL 将主动探索、视觉目标定位、自然语言意图消歧和物理操作统一到同一决策闭环中:系统以第一视角 RGB 观测为主要感知输入,并结合建图系统提供的承载区域(如桌面、柜子)作为搜索先验;当智能体在探索阶段发现多个候选目标时,智能体会主动汇报探索结果并请求用户细化指令(例如:「我找到了一个面包和两个不同的甜甜圈,您想要哪一个?」);智能体的询问由当前探索结果触发,用户反馈则进一步细化任务目标。通过这一机制,环境探索、意图确认与物理执行被统一到同一决策闭环中。



图 1. REAL 的工作模式与既往执行方式的对比

二、REAL:

面向开放世界移动操作的 Agentic 架构

REAL 构建于 InternUtopia 仿真平台之上,利用其高保真渲染能力、丰富的可交互仿真场景与资产,设计了适用于移动操作智能体的数据采集、训练和评测管线,最终形成了一套面向开放世界移动操作的 Agentic 框架。该框架的系统顶层架构由以下三大核心组件构成:

  • 大脑:智能体采用 Qwen3-VL-8B-Instruct 作为骨干视觉语言模型。大脑负责处理多模态观测信息、维护结构化的自摘要历史状态,并进行高层任务规划与工具调用。
  • 工具与接口:REAL 环境提供了一套不依赖特权感知信息的标准化工具链,主要包含:用于主动获取环境信息的四步探索工具(Nav_to、Walk_around、Show_object_by_category、Gaze_at),用于底层物理执行的控制接口(Pick、Place、Open、Close),以及用于发现歧义并提问的主动交互工具(Ask)。为了实现工具的有效组织,框架引入了模型上下文协议(Model Context Protocol,MCP)作为统一的接口标准。高层大脑只需输出离散工具调用,通过 MCP 服务器下发并执行,从而实现了认知规划与底层执行的解耦。
  • 状态与记忆:REAL 环境将 MCP 工具的返回结果组织为结构化多模态信息作为智能体的感知信息,其中包括视觉分割掩码及对应的物体类别、原始 RGB 观测、用户反馈,以及智能体自主总结的任务子目标和历史状态。这种设计在保留有效观测信息的同时,也有助于智能体始终围绕原始任务目标进行决策。



图 2. REAL 框架设计

基于这一顶层架构,REAL 在环境、数据与部署层面实现了三项核心贡献:

  • 无需特权感知的物理仿真环境:仿真器去除了直接定位目标的特权感知接口,要求智能体依靠工具链在场景节点中自由探索。同时,环境还引入了模拟用户,使智能体能够在执行中动态询问并对齐意图。
  • 自动化数据生成与双阶段训练管线:REAL 基于场景与资产自动组合任务,通过规则规划器生成可执行的专家轨迹,再利用 Gemini 3 Pro 模型为轨迹补充逐步推理和结构化历史状态。在此基础上,团队采用监督微调训练智能体的基础工具调用能力,并进一步通过在线强化学习训练其闭环探索、错误恢复与主动询问能力。
  • 统一接口下的仿真到现实部署:团队构建了包含 241 个任务实例的 REAL-Bench 以验证实际效果。得益于 MCP 协议,同一套高层策略能够零样本迁移至真实的双臂移动机器人,验证了框架的可部署性。

三、技术实现:

主动探索、沟通与高低层解耦

无特权感知的主动探索与交互

在 REAL 框架中,智能体仅接收可获取的结构先验,即承载区域或场景节点(如桌面、柜体)的 ID 与语义类别。为了定位目标,智能体通过四步探索工具链(导航、多视角扫描、目标检测、对齐注视)主动获取视觉信息。系统将检测到的 2D 分割掩码反投影到 3D 空间以构建临时探索地图,并通过 SoM(Set-of-Mark)为物体分配视觉 ID。后续的抓取、放置等操作均基于视觉 ID 调用,使机器人能够完成视觉目标定位与消歧,有效区分同类但外观不同的物体。同时,REAL 接入了一个由大模型驱动的模拟用户,它能依据当前已发现的物体和任务配置给出回答,使主动沟通成为由探索结果直接触发的执行环节。

基于 MCP 协议的高低层解耦执行

得益于 MCP 协议的引入,模型「大脑」可以始终专注于任务规划与状态跟踪,并输出统一格式的离散工具调用。在此机制下,仿真环境与真实环境通过统一的工具接口被抽象为一致的交互空间。当系统迁移到真机部署时,底层的连续物理控制由微调后的

SFT 与 GSPO:先完成工具对齐,再学习闭环决策

智能体采用 Qwen3-VL-8B-Instruct 作为基座模型,以兼顾多模态能力与机器人侧的推理效率。针对长程任务中容易出现的上下文膨胀问题,系统将决策过程建模为部分可观察马尔可夫决策过程,并使用结构化的自摘要历史状态,避免了在每一步重复拼接完整的交互轨迹。整个训练管线分为两个核心阶段:

  • 监督微调(SFT)实现工具对齐:在该阶段,系统利用规则规划器生成专家轨迹,并通过自动化标注模块将部分清晰指令改写为模糊指令,同时在轨迹中注入 Ask 调用及模拟用户的回答。这使得模型初步掌握了探索、操作和沟通工具的基础调用范式。
  • 在线强化学习(Online RL)提升自适应能力:为了避免模型陷入死板的轨迹模仿,REAL 引入了组序列策略优化(Group Sequence Policy Optimization,GSPO)进行闭环强化学习。相较于 GRPO,GSPO 将重要性比率与裁剪从 token 级提升到序列级,以更好地匹配序列级奖励,并提升变长轨迹强化学习的稳定性。奖励机制结合了环境状态变化、执行失败惩罚与提问预算,既鼓励智能体在必要时通过提问消除歧义,又防止其对用户产生过度依赖。

通过这套双阶段训练管线,训练后的策略会根据环境的真实反馈,自主决定何时继续探索、何时重新规划,以及何时向用户确认。

四、REAL-Bench:

评测设计与实验结果

REAL-Bench 共包含 241 个任务实例,分为四个任务族:

  • 家具干扰(Furniture-Distractor Pick-and-Place,FDP)(72 个):在存在同类家具干扰的场景中完成跨容器取放,考察主动探索与基础操作闭环;
  • 家具与物体干扰(Furniture & Object-Distractor Pick-and-Place,FODP)(56 个):同时加入家具级和物体级干扰,在开放词汇场景中考察细粒度视觉定位与消歧;
  • 家具干扰交互(Furniture-Distractor Open/Close,FDO)(48 个):围绕可开合的家具完成操作,考察动态视觉变化下的物品操作和时序一致性;
  • 模拟用户闭环控制(Simulator-User-Loop,SUL)(65 个):通过刻意设置的模糊指令,考察智能体能否主动调用 Ask,并根据用户反馈完成目标对齐。

四类任务共同覆盖「探索—定位—操作—沟通」的完整执行过程,并从不同侧面检验智能体应对视觉干扰、感知动态状态、交互决策和主动探索的能力。

实验结果:SFT 学会「用工具」,RL 学会「自主交互」



  • 工具对齐是形成感知—行动闭环的前提。未经训练的 Qwen3-VL-8B 在 FDP、FODP 和 FDO 上的成功率均为 0%,在 SUL 上仅为 1.5%;经过 1 个 epoch 的 SFT 后,FDP 成功率提升至 45.8%。
  • 单纯增加模仿学习可能损害开放场景泛化。当 SFT 由 1 epoch 增至 2 epochs 时,FDP 从 45.8% 提升到 65.3%,但干扰更强的 FODP 从 30.4% 降至 28.6%,说明严格模仿专家轨迹可能造成过拟合。
  • 在线 RL 有助于恢复自适应探索能力。以 1-epoch SFT 的模型为起点进行 GSPO 训练后,FODP 成功率提升至 33.9%,表明环境反馈能够推动模型进行动态调整,而非仅复现训练轨迹。
  • 在线 RL 在交互任务上的提升最为明显。REAL-8B 在 SUL 上达到56.9%,超过所有参与对比的零样本 VLM 基线,超越了作为教师模型的 Gemini-3-Pro-Preview(53.8%)和 GPT-5(52.3%)。这表明 RL 对于需要主动交互的任务具有更明显的成功率提升能力。

五、真机部署:60 个真实世界测试

episodes,78.3% 端到端成功率

为了验证 sim-to-real 能力,团队将训练得到的高层策略零样本迁移到ARX LIFT2 双臂移动机器人





图 4. 真实任务中的部署验证了 REAL 的有效性

「把面包放进微波炉」这一任务直观展示了 REAL 在长程任务中的规划与状态维护能力。机器人并没有直接前往柜子取面包,而是先打开微波炉,再去柜子抓取面包,最后返回微波炉,放入面包并关门。这一执行顺序体现了系统对任务前置条件与操作依赖关系的理解。与此同时,REAL 通过结构化历史状态持续记录并更新当前任务进展,进展中仅保留与后续决策相关、并经过工具反馈验证的信息,而非完整的历史交互轨迹,从而避免了上下文的快速增长,减少了执行中的状态遗忘与错误累积。

六、总结

REAL 的核心是重新设计仿真训练与真实部署之间的信息边界,使具身智能体不再依赖两项传统的理想化假设——依赖现实中无法获取的「完美感知」,以及假定用户总能给出明确、完整的指令,转而面向更真实的部署条件:智能体必须通过视觉探索主动获取环境证据,在必要时通过沟通补全用户意图,并最终调用可部署的物理技能完成任务。

在此基础上,REAL 借助统一的 MCP 工具接口,将高层视觉推理与具体物理执行后端深度解耦,使得同一套高层策略能够从仿真环境零样本迁移至真实双臂移动机器人。REAL-Bench 与真机实验一致表明,促使模型学会在「看不全、说不清、执行会失败」的非理想条件下持续闭环决策,提供了一条具身智能从受限基准迈向真实世界的有效路径

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
这个海航空姐,因为在飞机上帮乘客带娃火了

这个海航空姐,因为在飞机上帮乘客带娃火了

毒舌八卦
2026-09-12 17:51:49
从广州大学城GOGO新天地附近发生的恶意伤人事件,看人性到底有多恶劣?在外应该如何规避有可能的危险?

从广州大学城GOGO新天地附近发生的恶意伤人事件,看人性到底有多恶劣?在外应该如何规避有可能的危险?

贵重物品爱美食
2026-09-15 15:33:37
特朗普不再掩饰,曾当众喊话:还清40万亿美债,先问问美军同意不

特朗普不再掩饰,曾当众喊话:还清40万亿美债,先问问美军同意不

梁濆爱玩车
2026-09-14 20:24:10
宁在国外种榴莲,也不回国执教,带出92个冠军的李永波,如今如何

宁在国外种榴莲,也不回国执教,带出92个冠军的李永波,如今如何

梦醉为红颜一笑
2026-09-04 04:56:13
《星际争霸》新作确认是有明确结局的单机!并非赛季制

《星际争霸》新作确认是有明确结局的单机!并非赛季制

游民星空
2026-09-14 10:32:15
康辉哽咽,撒贝宁飚泪,朱迅痛哭,他们一生再优秀也对不住父母啊

康辉哽咽,撒贝宁飚泪,朱迅痛哭,他们一生再优秀也对不住父母啊

北海史记
2026-09-15 17:43:59
官方:阿迪达斯发布克罗地亚国家队全新球衣,欧国联首次亮相

官方:阿迪达斯发布克罗地亚国家队全新球衣,欧国联首次亮相

懂球帝
2026-09-15 16:05:13
中国制造的东风-15A战术弹道导弹首次实战,沙特拼了!

中国制造的东风-15A战术弹道导弹首次实战,沙特拼了!

小马姨
2026-09-15 09:30:06
尼克杨为娇妻庆生,退役当教练,和iggy分手娶黑人美女,家庭幸福

尼克杨为娇妻庆生,退役当教练,和iggy分手娶黑人美女,家庭幸福

大西体育
2026-09-15 11:16:43
高市早苗赌赢了!中国最担心的事发生了?

高市早苗赌赢了!中国最担心的事发生了?

故事终将光明磊落
2026-09-15 09:52:12
为什么全国肿瘤患者都奔赴广州?读懂TOMO刀精准放疗的优势

为什么全国肿瘤患者都奔赴广州?读懂TOMO刀精准放疗的优势

普陀动物世界
2026-09-13 20:10:57
涉毒被捕、消失两年?曾“斗鱼一姐”官宣复出,1天涨粉近百万

涉毒被捕、消失两年?曾“斗鱼一姐”官宣复出,1天涨粉近百万

阿讯说天下
2026-09-15 11:44:33
可惜了,一颗老鼠屎坏了一锅粥,《交锋》目前20集唯一败笔,减掉他们的戏份就完美了

可惜了,一颗老鼠屎坏了一锅粥,《交锋》目前20集唯一败笔,减掉他们的戏份就完美了

芬霏剧时光
2026-09-15 14:58:25
北京首钢官宣!前NBA勇士队球员加盟,新赛季三名外援全部确定

北京首钢官宣!前NBA勇士队球员加盟,新赛季三名外援全部确定

国篮会自强
2026-09-15 16:34:50
75岁以后才明白:把父母接到自己家养老,是这世上最高代价的孝顺

75岁以后才明白:把父母接到自己家养老,是这世上最高代价的孝顺

游戏收藏指南
2026-08-09 01:09:42
悲剧还是发生了!黑龙江女子因酷热将空调连续开了一天一夜,期间紧紧关闭门窗。随后她开始剧烈头痛、恶心头晕...

悲剧还是发生了!黑龙江女子因酷热将空调连续开了一天一夜,期间紧紧关闭门窗。随后她开始剧烈头痛、恶心头晕...

LULU生活家
2026-08-26 19:42:18
美国认证不灵了,中国突然停用旧规,600家外企现在往哪走?

美国认证不灵了,中国突然停用旧规,600家外企现在往哪走?

奇思妙想生活家
2026-09-15 06:56:57
网传大量失业人员挤满广州图书馆的“假装上班”,评论区炸锅...

网传大量失业人员挤满广州图书馆的“假装上班”,评论区炸锅...

慧翔百科
2026-09-15 08:29:26
一切都结束了!菲副总统萨拉被控是幕后黑老大,掏空6亿公款

一切都结束了!菲副总统萨拉被控是幕后黑老大,掏空6亿公款

甜心猫女
2026-09-14 12:41:12
5名河南犹太裔女孩赴以色列,称此生不归,8年后结局如何?

5名河南犹太裔女孩赴以色列,称此生不归,8年后结局如何?

南冥那只猫
2025-09-11 08:20:45
2026-09-15 18:43:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13997文章数 142733关注度
往期回顾 全部

科技要闻

芯片产业链蒸发超5000亿美元,特朗普大怒

头条要闻

诈骗团伙雇6个演员扮富豪 上海男子半年被骗1400多万

头条要闻

诈骗团伙雇6个演员扮富豪 上海男子半年被骗1400多万

体育要闻

皇马启动舆论攻势,为姆巴佩冲击金球造势

娱乐要闻

谢霆锋示爱王菲、和前妻划清界限

财经要闻

黄仁勋接到特朗普电话:AI风险论是"骗局"

汽车要闻

小鹏G9L第二代VLA体验:“理解时间”会推理的老司机

态度原创

亲子
健康
旅游
手机
公开课

亲子要闻

国庆东莞亲子 3 天 2 晚避开人潮!室内科普 + 户外遛娃太省心

脑血管里有个“不定时炸弹”?

旅游要闻

双节同庆,共赴盛世之约!济南方特“国风盛典”即将启幕

手机要闻

新一代骁龙旗舰平台蓄势待发,智能体手机终于能「办事」了?

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版