网易首页 > 网易号 > 正文 申请入驻

NVIDIA 李柏依:机器人只会「看」还不够,它还得学会「听」| ECCV 2026

0
分享至


给生成模型引入仿真,补上难以获得的声音感知。

作者丨张岂萍

编辑丨幸丽娟

机器人要进入真实世界,需要处理的信息远不止视觉。

倒水时,声音可以帮助判断杯子是不是快满了;物体发生碰撞时,不同材质会发出不同的声音;一个人在小房间和大房间里说话,空间回声也不一样。然而,这些人类习以为常的多模态感知,以及诸如切苹果、叠杯子这类极其复杂的双手灵巧操作,在机器人的训练阶段却面临着极其高昂的“数据采集壁垒”。

当机器人需要的数据很难直接采集,传统物理仿真又补不全这些信息时,还有没有别的办法?

在 ECCV 2026 主题为“Visual Perception and Reasoning in the Interactable World”的Workshop上,NVIDIA Research 科学家、UC Berkeley 研究者李柏依(Boyi Li)通过线上连线分享了她近期在这一方向上的两项工作。

她博士毕业于康奈尔大学,师从 Serge Belongie 与 Kilian Q. Weinberger,之后在 UC Berkeley 与 Jitendra Malik、Trevor Darrell 开展研究,目前研究重点包括具身智能中的高效多模态、泛化建模和交互智能系统。

面对这些难以直接采集的数据,她尝试了两条不同的路径:模拟器里没有的声音,可以“生成”出来;机器人身上昂贵的操作数据,也可以从人类视频里获得。

第一条路径是MultiGen。传统物理模拟器已经可以模拟相当逼真的倒水过程,却没有与画面同步的声音。李柏依团队利用现实世界中的视频和音频训练生成模型,再让它为仿真视频补上对应的声音。她将这个思路概括成一句话:“Don’t just simulate physics – generate perception”不只模拟物理过程,还要生成感知

另一条路径是DexImit。与其大量采集昂贵的双手机器人示范,团队尝试利用人类操作视频,恢复其中手与物体的交互,再将这些交互转化为机器人能够学习和执行的双手操作数据。

一个补上仿真世界里缺失的感知,一个把人类操作转化为机器人可以学习的示范。背后的思路是一致的:机器人训练需要的,不只是把物理世界模拟得更真实,还要把那些难以直接获得的感知和交互信息,变成机器人可以学习的数据。

以下是李柏依的演讲分享,AI科技评论根据其演讲内容进行了不改原意的编辑:


Efficient Multimodal Intelligence for Embodied Agents in Interactive Worlds(交互世界中的具身多模态智能)

01


机器人为什么需要“听见”世界?

我们一直在研究多模态系统。

现在的多模态已经不只是图像和语言,还包括 3D 几何、声音、嗅觉和触觉等信息。这些模态可以帮助模型进行泛化和推理,也可以用于机器人、医疗等真实场景。

今天我主要分享其中两个与机器人有关的工作。

先从声音开始。

我们先来看一个很有意思的任务。假设现在有一根水管正在往瓶子里倒水,你需要判断什么时候水会溢出来。如果没有声音,只看水管里的水流,其实很难判断瓶子里面发生了什么。

如果把声音加进来呢?

其实在日常生活中,我们一直在利用声音理解周围发生的事情。比如烤肉的时候,我们可以通过声音判断它的状态;玻璃碎了、门打开了、可乐被打开了、水烧开了,我们也可以通过声音知道发生了什么。

声音还能提供空间信息。在小房间、大房间,甚至更大的空间里说话,声音听起来都会不一样。它也可以帮助我们判断物体的材质和状态。比如洗碗的时候,不同材质的杯子、瓶子和盒子会发出不同的声音;有时候我们还会摇一摇薯片罐,通过声音判断里面是不是还有东西。

那机器人能不能也利用声音?

我们希望训练一个机器人策略,让它同时利用视觉、物理信息和声音,更准确地执行任务。要做到这一点,我们首先需要多模态数据。

但真实世界里的这类数据很难采集。

那 simulation 呢?现在的物理模拟器已经可以生成非常逼真的视觉效果。比如倒水,我们能够看到整个物理过程,看起来已经很真实了。

问题是,没有与画面对应的声音。


如果要训练同时利用视觉、物理信息和声音的机器人策略,我们就需要包含这些信息的多模态数据,而且不同模态之间还要彼此对应。现有的物理模拟器没办法提供这样的音频。

那这些声音从哪里来?

02


MultiGen:

不只模拟物理,还要“生成感知”

我们开始重新看已经拥有的数据。

现实世界里其实有大量同时包含视频和声音的数据,比如 YouTube 等来源的视频。我们把这些视频收集起来,作为In-the-Wild Data

我们的目标是训练一个Audio Generative Model:给模型一段视频,让它生成与视频内容对应、并且在时间上对齐的声音。我们选择 diffusion model 作为基础模型,在训练时输入视频,让模型学习生成对应的音频。


训练完成之后,我们发现这个模型对不同的视频内容有比较好的泛化能力。给它一段视频,它能够生成与画面对应的声音。

接下来,我们把物理模拟器生成的视频输入这个模型,让它生成对应的声音。这样,模拟器负责生成视觉信息和机器人的物理轨迹,生成模型负责补上音频,最后得到一套Simulated Multimodal Dataset


有了这些数据之后,我们就可以进一步训练同时利用视觉和声音的 Multimodal Robot Policy,再把它部署到真实环境中。

我们测试了不同的容器和液体。比如把液体倒进不规则的容器,机器人需要自己判断什么时候停止;换成可乐之后,声音和音高都发生了变化,但机器人仍然可以完成倒水任务。

我们还测试了环境变化。比如在倒水过程中把灯关掉,让视觉受到干扰,机器人仍然能够继续完成任务。我们也加入了背景噪声,在比较嘈杂的环境里,策略仍然能够识别倒水的声音。

为了进一步验证效果,我们比较了两种策略:一种只使用视觉,另一种同时使用视觉和声音。

先看不透明容器。因为无法直接看到容器内部的液体状态,只使用视觉时误差比较大;加入声音之后,误差明显下降。

我们也测试了透明容器。即使在这种情况下,视觉本身已经能够提供更多信息,加入声音之后,性能仍然有所提升。


我们还做了一个更直接的对比实验。两组实验保持完全相同的设置,一组机器人只使用视觉,另一组同时使用视觉和声音。倒水过程中,我们把灯关掉,等机器人判断应该停止之后,再把灯打开。

只使用视觉的时候,水已经溢出了杯子。

机器人在感知上其实非常脆弱。一旦视觉受到干扰,整个系统就很容易失效。在这种情况下,声音可以发挥很重要的作用,帮助系统变得更加鲁棒。

这也是我们最后想表达的:“Don’t just simulate physics – generate perception.”

不只模拟物理过程,还要生成感知。


03


DexImit:

机器人数据还能从哪里来?

刚才我们讲的是生成音频信号。

接下来,我们来看另一类与真实世界有关的交互信息:人和机器人怎样与真实世界中的物体发生交互。

这项工作的出发点很简单。我们关注Bimanual Dexterous Manipulation,也就是双手灵巧操作。它对于通用机器人非常重要,很多真实世界任务都需要两只手和灵巧操作,比如抓取、倒水、使用工具,以及长时序操作。


但真实机器人上的双手灵巧操作数据,采集起来既昂贵,又耗费人力。

与此同时,人类操作视频几乎是无限的。它们可以来自日常演示,也可以来自视频生成模型,而且这些视频本身就包含了人类操作物体的知识。

那我们能不能直接从人类视频中生成机器人的灵巧操作数据?

这就是我们提出DexImit的出发点。它的全称是Learning Bimanual Dexterous Manipulation from Monocular Human Videos。我们希望从人类视频出发,在仿真中生成模仿这些人类操作的机器人双手数据。


04


从一段人类视频,到真实机器人

具体怎么做?整个 pipeline 有四个阶段。


第一步是恢复人手和物体的运动。我们直接从一段单目人类视频开始,进行深度估计、手部姿态估计、3D 生成和物体的 6D pose estimation,最后把这些信息统一到 World Coordinate 中,得到手和物体随时间变化的 4D 交互轨迹。


但把轨迹恢复出来还不够。一段双手操作视频里,两只手可能同时在做不同的事情,一个长任务里也会连续出现多个动作。

所以第二步我们会把整个过程拆成不同的子任务,再安排两只手分别在什么时候执行什么动作。


接下来还有一个问题:人的手和机器人的手并不一样。

人的动作不能直接复制给机器人。我们需要根据前面恢复出来的交互,生成机器人真正能够执行的抓取姿态。这里我们会考虑 force closure 等物理约束,再通过 motion planning 生成平滑、无碰撞的机械臂轨迹,最终得到完整的仿真机器人示范。


得到这些数据之后,我们还会进行Augmentation。比如改变物体的位置和尺度、相机视角以及 observation,让训练出来的策略能够更好地泛化到真实世界。

数据质量同样很重要。我们还会利用视觉语言模型理解原始的人类操作视频,再检查生成出来的数据是否与原始操作一致。


那这些生成出来的数据到底能不能用?

我们主要想回答几个问题:生成的数据本身是不是有效?和已有方法相比,能不能得到更好的双手灵巧操作数据?面对更复杂、更长的任务还能不能工作?最后,能不能实现 zero-shot real-world deployment?

我们测试了不同来源和不同难度的人类视频。可以看到,人工采集的数据质量更好;随着任务变得越来越复杂,生成数据的准确性和可用性也会下降。


我们还和已有方法进行了比较。对于真实世界里更加复杂的任务,比如制作饮料、烹饪、切苹果和叠杯子,仅仅把视频中的动作恢复出来是不够的。尤其是long-horizon、fine-grained、contact-rich tasks,我们需要比较准确的 reconstruction,同时还要保证生成出来的动作交互在物理上是合理的。

比如切苹果,机器人不仅需要准确判断苹果的位置,还要控制切下去的力量,同时保证抓取足够稳定。



最后,我们进一步测试了 zero-shot real-world deployment。

为了让策略更好地泛化到真实环境,我们会对物体位置和尺度、相机视角以及 observation 做 augmentation。我们也做了 ablation study,分别改变其中一些设置。结果可以看到,完整方法的表现最好,这些 augmentation 对真实世界部署非常重要。


我们把 DexImit 生成的数据部署到了真实机器人上。

当然,DexImit 目前还有一些限制。

首先是柔性物体和关节物体。现在的 3D 生成阶段主要依赖 SAM 3D,它假设的是刚性物体几何,目前还不能很好地处理柔性物体或者带有关节结构的物体。未来可能需要更先进的 geometry reconstruction 或 generative modeling 来解决这个问题。

第二是移动操作。现在的方法主要面向桌面上的双手操作。如果机器人需要一边移动、一边操作物体,还需要进一步建模机器人本体的运动和环境动态。

第三是长视频。整个 pipeline 由多个模块连续执行,误差可能会随着时间不断累积。视频越长,这个问题越明显。有些情况下还是需要人工介入,比如调整基于 VLM 的子任务分解,或者修正重建过程中出现的问题。

最后是手内操作,比如在手里旋转一个橙子。这类任务中,手和物体之间会产生非常严重的遮挡,单目视频能够提供的信息有限,目前 DexImit 也没有专门针对这种情况设计机制。


我们的代码已经开源,大家感兴趣的话也可以进一步尝试。

05


Q&A 现场问答

Q1(现场观众):有没有哪些特定的噪声或声音,会对机器人策略产生负面影响?或者有些声音对人类有用,但机器人却无法利用?

李柏依:这是一个很好的问题,我们也一直在思考。比较有意思的是,我们在训练时其实没有做任何噪声增强(noise augmentation),但模型在有背景噪声的情况下依然比较鲁棒。我们猜测,可能是因为音频本身是一维信号,不同声音之间比较容易区分。比如模型训练过倒水的声音之后,即使环境中同时出现其他声音,也可以把不同的声音区分开。当然,这只是我们目前的推测。

Q2(现场观众):有没有一些任务,即使加入声音,对机器人也没有什么帮助?

李柏依:这个我们还没有测试。但很容易想到声音在哪些任务里发挥作用。比如当视觉信息受到干扰的时候,声音就很重要。对于其他任务,比如拿起一个杯子或者拿起手机,声音可能就没有那么重要。通常我们并不需要依靠声音去抓取手机或者杯子。

为了方便大家抱团交流、互通会议消息,我们专门建了ECCV 2026参会交流群!进群你会解锁这些「福利」

  • 会议情报站投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。

  • 同行茶话会天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。

  • 前沿补给站最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。

  • 现场后援团:(会议期间专属开启):到了会场也不用慌——

    路线导航场馆分布、报告厅怎么走,群里随时问;

    议题共读热门 session、Keynote 现场探讨,错过也能追;

    Poster 汇编现场海报精华整理,一键收藏不遗漏;

    约局广场约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。

进群传送门:扫码进群或添加微信Qvv0909777,备注:ECCV + 单位/学校+姓名+方向。

搞科研/搞技术,信息差很重要。

来,一起快人一步!

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
600053,被证监会立案!

600053,被证监会立案!

中国基金报
2026-09-18 20:59:54
CCTV5直播!U23国足VS伊朗,小组出线关键战 安东尼奥带队争2连胜

CCTV5直播!U23国足VS伊朗,小组出线关键战 安东尼奥带队争2连胜

生活新鲜市
2026-09-19 00:04:57
寿司在中国为什么不受欢迎?网友:你去看看寿司郎员工的一天呢?

寿司在中国为什么不受欢迎?网友:你去看看寿司郎员工的一天呢?

另子维爱读史
2026-09-18 20:29:18
特朗普:美国将获得对格陵兰岛安全“永久控制权”

特朗普:美国将获得对格陵兰岛安全“永久控制权”

澎湃新闻
2026-09-19 08:04:03
住建部:住房层高标准提高到3米,4楼及以上住宅须装电梯

住建部:住房层高标准提高到3米,4楼及以上住宅须装电梯

南方都市报
2026-09-18 15:30:09
商竣程发文谢球迷,谢尔顿退赛霍达尔晕倒,孙发京输党一鸣首胜

商竣程发文谢球迷,谢尔顿退赛霍达尔晕倒,孙发京输党一鸣首胜

网球之家
2026-09-18 16:01:21
前NBA球员迈克尔-斯维特尼去世,享年43岁

前NBA球员迈克尔-斯维特尼去世,享年43岁

陈意小可爱
2026-09-18 09:29:56
暴雨3小时39000人淋湿不离不弃!周深成“落汤鸡”,却被全网封神

暴雨3小时39000人淋湿不离不弃!周深成“落汤鸡”,却被全网封神

陈意小可爱
2026-09-18 11:18:46
巴媒:中国直21,世界第一,超越美国AH64E,可能有多大?

巴媒:中国直21,世界第一,超越美国AH64E,可能有多大?

万里繁华
2026-09-17 10:20:02
中国人在取外号这块简直就是天赋异禀!网友:笑点和功德打起来了

中国人在取外号这块简直就是天赋异禀!网友:笑点和功德打起来了

水泥土的搞笑
2026-09-13 08:49:20
东北大学学生筹资5000元向学院捐赠台球桌引争议,最新进展:学院已将筹得款项全部返还

东北大学学生筹资5000元向学院捐赠台球桌引争议,最新进展:学院已将筹得款项全部返还

扬子晚报
2026-09-18 07:56:00
6连胜!马雷斯卡在曼城站稳脚跟 选他接班瓜帅真对了

6连胜!马雷斯卡在曼城站稳脚跟 选他接班瓜帅真对了

球事百科吖
2026-09-18 09:24:08
自称战狼的都是什么货色,可想而知

自称战狼的都是什么货色,可想而知

基本常识
2026-09-18 00:47:59
突发!一场没打,76人中锋受伤了……

突发!一场没打,76人中锋受伤了……

体育新角度
2026-09-18 21:27:41
55岁胡兵分享近况,90岁老父亲中风住院,他在杭州长期租房陪伴

55岁胡兵分享近况,90岁老父亲中风住院,他在杭州长期租房陪伴

柒佰娱
2026-09-18 09:11:11
CCTV5直播!国足VS马尔代夫,邵佳一掀起青春风暴,赵松源有望创历史

CCTV5直播!国足VS马尔代夫,邵佳一掀起青春风暴,赵松源有望创历史

篮球圈里的那些事
2026-09-18 14:52:35
人民日报发声:机关事业单位的隐性收入,正在消失

人民日报发声:机关事业单位的隐性收入,正在消失

细说职场
2026-09-18 16:35:31
U23国足VS伊朗首发预测!吴曦领衔,安东尼奥欲变阵,拜合拉木或顶替王钰栋

U23国足VS伊朗首发预测!吴曦领衔,安东尼奥欲变阵,拜合拉木或顶替王钰栋

大卫的篮球故事
2026-09-18 16:52:39
教育界有个“托举悖论”:你替孩子铺的路越平坦,孩子自己的路就越难走;高段位父母只做两件“减法”

教育界有个“托举悖论”:你替孩子铺的路越平坦,孩子自己的路就越难走;高段位父母只做两件“减法”

心理观察局
2026-06-23 06:58:08
iPhone 18开售首日实探:标准版Pro没人要,Pro Max回收加价400元,黄牛称“到晚上手上囤货兴许得赔”

iPhone 18开售首日实探:标准版Pro没人要,Pro Max回收加价400元,黄牛称“到晚上手上囤货兴许得赔”

搜狐科技
2026-09-18 20:04:14
2026-09-19 08:59:00
AI科技评论 incentive-icons
AI科技评论
点评学术,服务AI
7655文章数 20783关注度
往期回顾 全部

科技要闻

直击iPhone 18新机发售:黄牛加价不如前代

头条要闻

牛弹琴:菲律宾南海挑事 在中国人无法忘记的特殊日子

头条要闻

牛弹琴:菲律宾南海挑事 在中国人无法忘记的特殊日子

体育要闻

好吧,中国男篮辛苦了

娱乐要闻

陈思诚 佟丽娅不想让儿子知道两人离婚

财经要闻

研发0.25亿理财26亿,敷尔佳豪赌三类器械

汽车要闻

纯电/插混双动力+五座/六座双布局 海狮08应该怎么选?

态度原创

教育
数码
游戏
手机
公开课

教育要闻

学校不是“无限责任公司”——给校长的校园安全责任地图与操作清单

数码要闻

代际提升78%!AMD 256核EPYC 9996跑分曝光:至强6980P不是对手

艾达王凭啥这么高?《生化》"十大正派"票选遭质疑

手机要闻

苹果介绍旗下首款折叠屏手机iPhone Duo设计理念

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版