网易首页 > 网易号 > 正文 申请入驻

突破模型瓶颈:QDepth-VLA让机器人拥有更精准的3D空间感知

0
分享至

视觉-语言-动作模型(VLA)在机器人操控领域展现出巨大潜力。通过赋予预训练视觉-语言模型(VLM)动作生成能力,机器人能够理解自然语言指令并在多样化场景中展现出强大的泛化能力。然而,这类模型在应对长时序或精细操作任务时,仍然存在性能下降的现象。

这种现象的根源在于,模型虽具备语义理解能力,却缺乏对三维空间的几何感知与推理能力,导致其难以准确捕捉如机械臂夹爪与物体之间相对位置关系等关键三维信息。

为此,由中国科学院自动化研究所与灵宝 CASBOT 共同提出了QDepth-VLA—— 一种结合量化深度预测(Quantized Depth Prediction) 的 3D 信息增强型 VLA 模型。它通过独立的Depth Expert模块来学习离散化的深度表示。这种设计在保持原有语义对齐能力的同时,显著提升了机器人在复杂操作场景下的空间推理与操控精度。

  • 论文标题:QDepth-VLA: Quantized Depth Prediction as Auxiliary Supervision for Vision–Language–Action Models
  • 论文链接:https://arxiv.org/pdf/2510.14836

研究背景

如何让模型具备真实三维空间理解能力,一直是视觉 - 语言 - 动作领域面临的关键挑战。尽管 VLA 模型在语义理解与指令跟随方面取得了显著进展,但其空间感知能力仍然有限。当任务涉及精细化或长时程多步骤操作时,模型往往难以建立稳定的三维几何关联,导致定位误差和操作失败。

为填补二维视觉语义理解与 3D 空间感知之间的鸿沟,研究者近年开始探索将三维信息融入 VLA 模型的多种路径。主流方向可分为三类:

1. 直接注入 3D 特征。这类方法通常将点云或深度图编码为三维特征,再与 VLM 主干网络或动作专家模块融合,从而显式引入几何信息。尽管能够提供更丰富的空间线索,但这种方式显著增加了模型复杂度,并可能破坏大规模 VLM 预训练中形成的二维视觉先验。

2.3D 特征投影方法。另一类方法将三维特征投影为多视角二维图像,再输入原有视觉 - 语言结构。该策略在最大程度上保持了 VLM 的视觉语言能力,但投影过程不可避免地造成信息损失,难以保留细粒度的空间几何特征。

3. 辅助 3D 视觉预测任务。相比直接融合 3D 特征,最新的趋势是通过引入辅助任务(如深度估计或未来场景预测)来隐式强化模型的三维空间理解。这种方式无需额外传感器输入,具有更好的兼容性与可扩展性,是一条更具潜力的研究路线。

然而,已有工作表明,这类基于深度预测的辅助监督并非总能带来性能提升。例如,DreamVLA 等研究发现,直接以像素级深度图作为辅助任务可能引入噪声监督或冗余信号,反而削弱模型的策略学习稳定性。因此,如何设计更高效、语义一致的深度监督机制,使 VLA 在保持二维视觉语义理解的同时获得稳健的三维感知能力,仍然是当前研究的核心难题。

方法设计

为解决深度预测辅助任务存在的监督噪声和信号冗余问题,中国科学院自动化研究所与灵宝 CASBOT 共同提出了QDepth-VLA,通过引入量化深度预测机制与混合注意力结构,使模型在保持语义一致性的同时,获得稳健的三维空间感知与动作决策能力。整体方法包括三部分 (如图):

1.深度图标注

首先采用 Video-Depth-Anything 对视频帧进行高精度深度标注,显著提升了时空一致性,从源头上减少了噪声和漂移。

2.深度量化与 Depth Expert

为了避免直接预测像素级深度图的噪声干扰,首先分别利用标注好的数据集分别训练对应的 VQ-VAE,之后使用 VQ-VAE 对深度图进行离散化编码,将其转化为结构化的深度 token。模型优化目标如下:

设计了独立的 Depth Expert 模块,其结构与 Action Expert 相似,均基于 Transformer 架构,用于预测深度 token,从而在不干扰视觉 - 语言主干的前提下提供稳定的几何感知信号。

3.混合注意力机制

为实现跨模态融合,减小深度模态可能存在的噪声干扰,团队还设计了Hybrid Attention Mask,在不同模态间调控信息流:

  • 文本与图像 token 仅在各自模态内自注意,保持语义一致性;
  • 深度 token 同时关注图像与文本,获得语义上下文;
  • 动作 token 则融合前述所有模态,实现视觉 — 深度 — 动作一体化建模。

这种块状注意力设计有效防止深度噪声干扰动作生成,同时保持不同模态之间的对齐能力。

4.联合优化目标

整体训练目标整合动作与深度两类监督信号:

通过上述设计,QDepth-VLA 实现了视觉语义、空间几何与动作策略的协同学习,在多任务、多场景中展现出更强的泛化与稳定性。

实验验证

为全面评估 QDepth-VLA 的性能,团队在两个主流机器人仿真环境 (SimplerLIBERO) 与真实环境下进行了测试,涵盖多种物体抓取、空间定位与多步操作任务。结果显示,QDepth-VLA 在不同测试平台上均取得了显著提升。

这些结果验证了该方法能够有效提升模型在长时程、多场景操作任务中的任务完成能力。

1. Simpler 仿真结果

在 Simpler 任务中,分别基于 Bridge V2 与 Fractal 数据集从头训练了 QDepth-VLA。实验结果表明,在 Simpler 仿真器 的 WidowX250 与 Google Robot 任务上,相比基础模型 Open π0,平均成功率分别提升了8.5% 与 3.7%

2. LIBERO 仿真结果

而在 LIBERO 任务中,QDepth-VLA 则在 Fractal 数据集小规模预训练得到的权重基础上,进一步在对应的 LIBERO 数据集上进行微调。如下图所示,在 LIBERO 仿真器上,相较于基于深度图输入的 3D-CAVLA,QDepth-VLA 依然保持领先,平均提升约 2.8%。

3. 真机实验结果

  • Task1 : pick the banana into the yellow basket
  • Task2 : put the chili into the bowl
  • Task3 : put the green block into the bowl
  • Task4 : stack the green block ontop of the yellow block

4. 消融实验

为了验证 QDepth-VLA 各组件的实际贡献,团队还在 Simpler 任务上进行了系统的消融实验。

当团队将深度损失权重设为 0,仅保留模型结构时,平均成功率由 68.5% 降至 65.6%,尤其在 Carrot(-9.6%)和 Eggplant(-12.5%)任务上下降明显,表明深度监督确实提供了有意义的空间几何先验。相反,移除 Depth Expert 后,性能下降最为显著(-8.5%),在需要精准三维对齐的 Stack Block 任务中跌幅高达 - 23.8%,验证了显式深度分支对立体空间感知的关键作用。

此外,将潜在深度预测替换为像素级回归导致平均性能下降至 64.6%,说明量化深度表征更能捕捉抽象几何信息。而移除混合注意力机制(Hybrid Attention)后,模型在 Carrot 任务中的表现显著下降(-15.8%),表明该机制能有效协调深度感知与动作生成。

总体来看,深度监督与混合注意力的协同作用是 QDepth-VLA 取得高性能的关键,它们共同强化了模型的空间理解与动作一致性,为复杂操控任务提供了稳定的三维感知基础。

总结与展望

QDepth-VLA 作为一种将量化深度预测引入视觉 - 语言 - 动作建模的机制,旨在增强机器人在三维空间中的感知与推理能力。基于 Simpler、LIBERO 以及真实环境的系统实验结果显示,引入量化深度监督能够在长程与精细操作任务中带来显著的成功率提升,说明三维几何先验在机器人稳定操控中具有重要价值。

未来的研究方向可主要围绕以下两点展开:

  • 面向未来的深度预测:在当前深度推断基础上扩展至未来时刻的空间结构预测,以支持更长时程的策略规划;
  • 更高效的深度表征学习:通过改进 VAE 编码与表征压缩方式,进一步提升深度信息的精确度、可泛化性与推理稳定性。

总体来看,QDepth-VLA 为增强 VLA 模型的空间理解能力提供了一条兼具语义一致性与工程可落地性的路径。从具身智能的发展趋势来看,具备真实三维空间理解能力的策略模型,是机器人从 “可演示” 迈向 “可长期实际工作” 的关键基础。QDepth-VLA 强化的三维几何感知与动作一致性能力,将作为核心能力模块逐步融入灵宝 CASBOT 的多产品序列中:

  • CASBOT 02:用于支持桌面级与生活化任务中的稳定抓取、递交、精细放置;
  • CASBOT W1:用于工业与商服场景下的多步骤、多对象柔性操作;
  • Handle-L1 灵巧手:用于更高精度、多接触点的结构化操控与协作。

在此路径中,深度量化表征、跨模态一致性建模与在线自适应学习将持续协同演进,支撑灵宝 CASBOT 构建从模型 — 本体 — 场景 — 部署的长期闭环能力,推动具身智能走向可规模化、可复制、可持续的真实应用阶段。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
约满 限流 全国多处景区发布公告

约满 限流 全国多处景区发布公告

极目新闻
2026-10-04 15:42:24
办百日宴摆了28桌,只来15个客人!家长:礼钱都没看到,亏大了!

办百日宴摆了28桌,只来15个客人!家长:礼钱都没看到,亏大了!

磊子讲史
2025-09-24 14:17:06
一部30年没人敢拍的电影,终于要拍出来了

一部30年没人敢拍的电影,终于要拍出来了

独立鱼
2026-10-04 21:05:26
现场直击巴西总统选举首轮投票

现场直击巴西总统选举首轮投票

新华社
2026-10-04 21:10:27
兰香如故:98%的人没看懂,林绣茹能用和离拿捏住袁家,最重要的不是因为有林家一众撑腰,也不是她自己多会谋算,而是这一点

兰香如故:98%的人没看懂,林绣茹能用和离拿捏住袁家,最重要的不是因为有林家一众撑腰,也不是她自己多会谋算,而是这一点

浅浅四月
2026-10-03 19:16:21
阿根廷7-0狂胜,产生4个事实:没有梅西依然很强,10号可给劳塔罗

阿根廷7-0狂胜,产生4个事实:没有梅西依然很强,10号可给劳塔罗

球场没跑道
2026-10-04 10:23:52
央视主持人边策:和母亲通话1小时后坠楼身亡,他都经历了什么?

央视主持人边策:和母亲通话1小时后坠楼身亡,他都经历了什么?

琴琴有氧运动
2026-10-05 01:56:34
女单32强定16席:国乒占7席!石洵瑶完胜世界冠军,日本2人晋级

女单32强定16席:国乒占7席!石洵瑶完胜世界冠军,日本2人晋级

乒烧泳球
2026-10-04 21:43:34
1982年巩俐印刷厂临时工时与前男友的合影机遇加自身努力成就了她

1982年巩俐印刷厂临时工时与前男友的合影机遇加自身努力成就了她

可乐谈情感
2026-10-05 00:47:04
气场全开!李梦携手金卡戴珊亮相上海,女篮一姐商业价值藏不住了

气场全开!李梦携手金卡戴珊亮相上海,女篮一姐商业价值藏不住了

动物奇奇怪怪
2026-10-02 09:27:50
五千亿国补砸下来,为什么没有把消费拉起来?网友说:精准补贴不缺钱的人!

五千亿国补砸下来,为什么没有把消费拉起来?网友说:精准补贴不缺钱的人!

黯泉
2026-10-04 11:12:25
中日对峙若继续拖延下去,越来越多国家终将意识到:中日一旦开战,不会像俄乌冲突那样给第三方留下渔利空间,而注定是一场惨烈血战

中日对峙若继续拖延下去,越来越多国家终将意识到:中日一旦开战,不会像俄乌冲突那样给第三方留下渔利空间,而注定是一场惨烈血战

人生录
2026-10-02 20:33:29
深圳APEC开幕在即,中方拒称“首相”,高市早苗遭外交冷遇

深圳APEC开幕在即,中方拒称“首相”,高市早苗遭外交冷遇

爱看剧的阿峰
2026-10-05 01:40:34
史上最强厄尔尼诺强势登场?今年冬天偏暖还是冻哭,答案终于来了

史上最强厄尔尼诺强势登场?今年冬天偏暖还是冻哭,答案终于来了

混沌录
2026-10-05 00:00:17
注意了!特斯拉宣布部分 Model Y 存在问题需要召回维修!

注意了!特斯拉宣布部分 Model Y 存在问题需要召回维修!

XCiOS俱乐部
2026-10-04 08:40:29
韩国上班的华人坦言:不要信媒体,韩国已经相当于我国二线城市

韩国上班的华人坦言:不要信媒体,韩国已经相当于我国二线城市

据说说娱乐
2026-10-03 14:07:55
万万没想到!俄选举落下帷幕,拉夫罗夫体面退场,梅德韦杰夫出局

万万没想到!俄选举落下帷幕,拉夫罗夫体面退场,梅德韦杰夫出局

井普独白
2026-10-03 14:30:09
前英格兰国脚确认,性侵自己的是舞蹈教练,曾被打晕,已入狱服刑

前英格兰国脚确认,性侵自己的是舞蹈教练,曾被打晕,已入狱服刑

小金体坛大视野
2026-10-04 10:12:17
为省18元油钱耗4小时!增程车挤200辆队伍充电引大争论

为省18元油钱耗4小时!增程车挤200辆队伍充电引大争论

快科技
2026-10-04 15:30:04
什么情况?曝萨姆纳手部受伤前往医院治疗 广东男篮第三外援成悬案

什么情况?曝萨姆纳手部受伤前往医院治疗 广东男篮第三外援成悬案

狼叔评论
2026-10-04 23:20:04
2026-10-05 03:36:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14123文章数 142744关注度
往期回顾 全部

科技要闻

苹果确认:iPhone 18 Pro Max有问题

头条要闻

30多岁中国夫妇在澳洲遇惨烈车祸丧生 肇事司机仅17岁

头条要闻

30多岁中国夫妇在澳洲遇惨烈车祸丧生 肇事司机仅17岁

体育要闻

32胜0负!德约2-1逆转头号种子兹维列夫 第7次晋级中网四强

娱乐要闻

高晓松悄悄复出:官媒没给他留体面

财经要闻

OpenAI前安全部门员工:公司文化已崩坏

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

手机
数码
亲子
时尚
教育

手机要闻

iPhone18 Pro:首销破百万,国产旗舰首销总和不到人一半!

数码要闻

联想推出Lenovo Watch Fit 3智能手表,199元

亲子要闻

原来孩子在出生前就和当妈的早有渊源!网友:爹算是赠品!

谭卓&胡一天,邀你一起“网”下面基

教育要闻

一年级只招1人,大批学校撤并,农村小学还有未来吗?

无障碍浏览 进入关怀版