网易首页 > 网易号 > 正文 申请入驻

主动理解物理世界:ROMA让机器人学会交互探索物体

0
分享至



我见,我摸,我理解。

人类认识一个物体,从来不只是「看」。看到一个盒子,我们可能会拿起来掂一掂,判断它有多重;我们可能会摇一摇,听听里面有没有东西;还可能会捏一捏,试试它软不软。人类感知世界的过程不是被动地接受已有的感官信息,而是在发现我们对身边事物不够了解时,主动地与之交互,根据交互的信息补全对世界的物理理解。

来自人大高瓴GeWu-Lab、智源研究院、燧行 AresoX 等机构的研究者所提出的ROMA (Real-World Object-Centric Multi-Sensory Active Perception),正是希望将这种主动感知物理世界的能力赋予多传感器机器人。该工作全面地从数据集与 Benchmark、多模态推理模型和物理交互系统展开对具身多模态主动感知的系统研究,希望为下一代主动具身 Agent铺平道路。



图 1 | 真实世界多模态主动感知系统 ROMA

  • 论文标题:ROMA: LLM System for Real-World Object-Centric Multi-Sensory Active Perception
  • 论文地址:https://arxiv.org/abs/2610.06955
  • 项目主页:https://gewu-lab.github.io/ROMA/
  • 数据集与模型:https://huggingface.co/datasets/GeWuLab/ROMA
  • 开源代码:https://github.com/GeWu-Lab/ROMA

如果当前的信息不足以完成任务,

机器人应该怎么办?

想象这样一个场景:人类和机器人说「帮我找个杯子装点茶」。机器人需要首先明白人类的意图是想找一个空的杯子,然后从各种可能的候选物体中,找到这一空杯子。它可能需要通过摇一摇、掂一掂,才能判断哪个杯子是空的。这一稀松平常的场景反映了一个关键的具身研究问题:机器人不仅需要理解人类指令中隐含的意图,还需要知道完成当前任务还缺少什么信息,这些信息需要通过什么方式、哪些感知模态来主动地获取。

ROMA 正是围绕这一关键问题,给出了一套从数据集和Benchmark,到推理模型和物理系统的完整方案。它将视听触力四大常用模态的感知整合到ROMA-7B模型中,并教会机器人判断自己缺什么信息,确定和哪个物体交互、怎么交互、关注什么模态、是不是已经足以完成任务了,并顺利地执行这些交互来获得多模态反馈,形成一个完整的推理-交互-反馈循环。

ROMI-2K:近 2000 个真实物体,

多感官交互数据

要让机器人学会主动地交互与探索,一个核心的挑战在于:机器人需要理解不同的物理交互会带来什么信息。为此,研究团队构建了一个大规模真实世界多模态物体交互数据集ROMI-2K,覆盖近 2000 个日常物体与内含物组合,并围绕 6 种基础物理交互(举起、按压、碰撞、捏紧、摇晃和旋转),进行手持设备和真实桌面机械臂场景的数据采集。每次与物体的交互同步采集视觉、听觉、触觉和力四种模态的观测信息,同时对物体材质、硬度、粗糙度、纹理、内容物等物理属性进行详细的标注。在此基础上,研究团队进一步构建了场景级多模态主动感知问答数据,让模型学习根据当前任务选择合适的交互行为与感知模态,以获取缺失的关键证据。



图 2 | 真实世界多模态物体交互数据集 ROMI-2K

ROMA Bench:从交互到「感知链」

在主动感知过程中,一次交互获得的模态观测,会影响下一次交互的选择。例如,通过摇晃判断物体是否为空时,如果物体发出了明显的内含物声音,便不再需要交互。而没有发出声音时,也不能排除是内含物将物体内部填满了,需要再掂一掂重量来确认。这就形成了一条由推理-交互-反馈不断串联起来的感知链。基于感知链这一重要概念,研究团队在 ROMI-2K 的真实桌面子集上进一步构建了ROMA Bench,包含2,100 个场景级主动感知任务,覆盖:(1)Single-Chain:单属性推理;(2)Multi-Chain:多属性、长链推理;(3)Intent-Driven:根据用户隐含意图确定需要获取的属性并推理。任务涉及硬度、粗糙度、纹理、内容物、材质和重量等多种物理属性。这使得主动感知脱离「做一次交互然后回答问题」的简单范式,而是形成一个需要完整的目标选择、动作选择、模态选择和连续推理的过程。



图 3 | ROMA Bench 多模态主动感知任务示例

ROMA 系统:物理接口与会主动决定交互的 ROMA-7B

ROMA Bench 为考察驱动机器人的模型是否「知道该怎么探索」提供了可能,而 ROMA 系统则进一步让这种能力真正地进入物理世界。研究团队搭建了一套真实世界多模态物理交互系统,将视觉、听觉、触觉和力四种感知模态与机械臂连接,并设计统一的物理交互接口,使模型能够直接输出真实物体的交互指令。

具体而言,ROMA 将抓取和 ROMI-2K 中的六大基础交互动作程序化,并基于 AnyGrasp 抓取策略,搭配精心设计的点云补全、抓取筛选和增强机制,提升真实世界中的稳定抓取能力,将交互决策可靠地转化为真实世界中的物理动作。

在此基础上,研究团队基于 Qwen 2.5-Omni,通过多传感器联合对齐和主动感知场景微调训练了 ROMA-7B 主动感知模型。它能够结合当前任务目标和已有的观测信息,主动地决定抓取哪个物体、执行什么交互、需要哪些模态的信息,以及该何时停止探索,并根据每次交互获得的新数据动态地调整后续的交互,形成「推理-交互-反馈-再推理」的闭环,让机器人能够主动地通过与世界交互,不断完善对物理世界的理解。



图 4 | ROMA 真实世界主动多模态物体感知系统示意图

多模态主动感知能力整体打平 GPT-6 Astra,领先多款前沿大模型

在多模态主动感知 ROMA Bench 的 2100 道多选题、判断题和排序题上,ROMA-7B取得 72.9%的总体任务成功率,整体表现基本与最新的GPT-6 Astra持平,并明显优于GPT-5.4和Gemini 3.5 Flash。GPT-6 Astra 凭借更强的视觉理解与通用推理能力,在单步、视觉可推断属性上表现突出;而 ROMA-7B 则在需要连续交互、综合多种模态反馈,尤其是音频的 Multi-Chain 任务中展现出更强的优势,明显超过 GPT-6 Astra。

相比之下,参数规模相近的未经过 ROMI-2K 微调的Qwen 2.5-Omni和Qwen 3-Omni在面对 ROMA Bench 所要求的目标选择、交互指令遵循和多模态主动推理时表现明显不足。这也体现了ROMI-2K 数据集的核心价值:通过大规模真实物体交互时的同步视觉、音频、触觉和力数据,为学习多模态主动感知能力提供了关键的训练基础,使 ROMA-7B 能够以仅 7B 的模型规模获得接近 GPT-6 Astra 的多模态主动感知能力,并超越其他前沿闭源模型。



表 1 | ROMA Bench 多模态主动感知测评结果

在真实世界实验中的 8 个多物体场景、132 道开放问答题上,ROMA-7B 仍取得 61.4%的总体成功率,接近于 GPT-6 Astra 并仍然大幅领先其他前沿大模型,证明通过 ROMI-2K 学习到的主动感知能力能够在真实世界的场景中保持,而不是仅仅局限于基准测试中的固定任务形式。



表 2 | 真实世界多模态主动感知测评结果



图 5 | Single-Chain 任务完成演示(ROMA全自动,2.5倍速)



图 6 | Multi-Chain 任务完成演示(ROMA全自动,2.5倍速)



图 7 | Intent-Driven 任务完成演示(ROMA 全自动,2.5倍速)

从 ROMA 出发,

迈向更主动的多模态具身智能

ROMA 目前主要围绕 6 种基础物理交互展开研究,但这只是一个起点。作为一个基础性的系统工作,ROMA 未来可以进一步启发并探索:更丰富的交互 Skill、主动感知与操纵策略的统一、多轮对话与长时序推理、跨场景的持久物体记忆、面向不同机器人形态的主动感知等。正如开篇所说:我见,我摸,我理解。ROMA 希望让机器人也能主动与世界交互,并通过一次次的探索真正理解世界。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
塔利班在莫斯科当众掀桌,拒签联合声明!对华对俄的态度判若两人

塔利班在莫斯科当众掀桌,拒签联合声明!对华对俄的态度判若两人

麓谷隐士
2026-10-10 00:10:04
中国赛-申京三双火箭大胜独行侠 杜兰特15分范乔丹复出17+7

中国赛-申京三双火箭大胜独行侠 杜兰特15分范乔丹复出17+7

醉卧浮生
2026-10-09 22:31:29
杀人祭天!一个中国人卖40万!国庆“最炸裂”热搜背后的恐怖,你根本想象不到

杀人祭天!一个中国人卖40万!国庆“最炸裂”热搜背后的恐怖,你根本想象不到

脆皮先生
2026-10-08 21:18:52
新华社删除尊界汽车,彻底结束了!

新华社删除尊界汽车,彻底结束了!

财经三分钟pro
2026-10-09 16:32:40
懂车帝也太刚了!

懂车帝也太刚了!

胖胖说他不胖
2026-10-09 15:08:05
懂车帝怂没怂根本不重要,发声就是意义

懂车帝怂没怂根本不重要,发声就是意义

关尔东
2026-10-09 20:35:29
华为客服回应“华为手机上懂车帝App相关视频无法播放”

华为客服回应“华为手机上懂车帝App相关视频无法播放”

21世纪经济报道
2026-10-09 18:47:46
突发!孙宇晨大概率崩了!

突发!孙宇晨大概率崩了!

财经要参
2026-10-10 07:23:31
制动系统厂家董事长发文:个别媒体牺牲中国品牌口碑获取流量,不敢恭维

制动系统厂家董事长发文:个别媒体牺牲中国品牌口碑获取流量,不敢恭维

蓬勃新闻
2026-10-09 15:03:12
开拓者主帅:瀚森传球出色能当进攻支点 机会出现完全放心派他上场

开拓者主帅:瀚森传球出色能当进攻支点 机会出现完全放心派他上场

罗说NBA
2026-10-10 06:26:35
英明领袖被虏走,经济反而高增长,像极了那一年……

英明领袖被虏走,经济反而高增长,像极了那一年……

家传编辑部
2026-10-10 10:21:00
加拿大、丹麦、德国、法国、意大利、日本、荷兰、英国,发表联合声明

加拿大、丹麦、德国、法国、意大利、日本、荷兰、英国,发表联合声明

政知新媒体
2026-10-10 07:51:17
中国汽车不需要华为模式

中国汽车不需要华为模式

凤眼论
2026-10-08 23:07:12
湖南永州周某某,颜值高气质好,湖南大学本科毕业,18岁就工作了

湖南永州周某某,颜值高气质好,湖南大学本科毕业,18岁就工作了

江山挥笔
2026-10-09 10:08:39
中国开始战备动员,多地百姓自发参战,3大信号放出,会干日本?

中国开始战备动员,多地百姓自发参战,3大信号放出,会干日本?

有范又有料
2026-10-10 02:21:29
尊界刹车踏板供应商指向凯众股份?公司回应:江淮是客户但体量很小,具体供应车型等细节保密

尊界刹车踏板供应商指向凯众股份?公司回应:江淮是客户但体量很小,具体供应车型等细节保密

蓝鲸新闻
2026-10-09 16:07:12
中欧谈判在京收场,欧盟彻底认清现实,得罪中国不值当

中欧谈判在京收场,欧盟彻底认清现实,得罪中国不值当

麓谷隐士
2026-10-10 00:10:04
河北沧州一女子花15元网购9斤蜜薯后申请仅退款,称有本事就过来拿,商家跨省驱车来回800公里连夜取回:最终只拿回3斤,就是为了出一口气

河北沧州一女子花15元网购9斤蜜薯后申请仅退款,称有本事就过来拿,商家跨省驱车来回800公里连夜取回:最终只拿回3斤,就是为了出一口气

扬子晚报
2026-10-10 07:35:46
最新!湖南永州女干部事件持续发酵,保证书内容炸裂,多个细节被扒,果然有问题

最新!湖南永州女干部事件持续发酵,保证书内容炸裂,多个细节被扒,果然有问题

子非鱼人
2026-10-09 22:43:11
62岁马云现身NBA中国赛!猛拍成龙大腿 与贝克汉姆蔡崇信热聊

62岁马云现身NBA中国赛!猛拍成龙大腿 与贝克汉姆蔡崇信热聊

念洲
2026-10-10 08:06:17
2026-10-10 12:35:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14167文章数 142748关注度
往期回顾 全部

科技要闻

上世纪成熟的踏板,为何今天还会断裂?

头条要闻

牛弹琴:诺奖没颁给特朗普当事人很生气 严重后果来了

头条要闻

牛弹琴:诺奖没颁给特朗普当事人很生气 严重后果来了

体育要闻

与C罗硬碰硬,一个72岁老人的倔强

娱乐要闻

王仁君获飞天视帝,赵丽颖发文祝贺

财经要闻

蹭尊界流量?岚图汽车在“玩火”

汽车要闻

2027款深蓝L06及追风版上市 限时权益价11.49万元起

态度原创

时尚
本地
游戏
手机
军事航空

时尚早知道!2027春夏十大流行趋势

本地新闻

踏访沙县第一村,寻国民小吃本源

《英雄联盟》EMEA Masters据称临时换版,教练称备战仓促

手机要闻

一加16配置面面俱到 还有凡人修仙传联名礼盒

军事要闻

美乌将举行新一轮会谈

无障碍浏览 进入关怀版