来源:市场资讯
(来源:DeepTouch CAAI认知系统与信息处理专委会)
导语:双手机器人做装配、扔垃圾这类接触密集任务时,常出现一种尴尬的失败——“看起来成功了,实际上没扣上”。视觉策略自信满满地撤手,盖子却没盖紧,插头也没对齐。根源在于:接触状态往往不可见。近日,北京通用人工智能研究院(BAAI)联合慕尼黑工业大学、清华等机构的研究者,在ICML 2026上发表了一项名为DECO的工作,用一个插件式触觉适配器在冻结视觉策略的情况下加入触觉,将接触密集任务的成功率提升了20个百分点。更重要的是,它揭示了一个深刻的设计洞察:触觉不是所有任务都需要,但它补的恰恰是视觉永远看不到的那层物理真实。
一、双手操作不是“多一个机械臂”那么简单
双手灵巧操作与单臂操作之间有一道本质鸿沟。
两只手需要协调动作,物体接触状态需要持续稳定,还要在遮挡、滑动和力反馈变化中实时调整。很多视觉策略在“拿起、放下”这类任务上已经不错,但一进入开盖、插接、压紧、装配等场景,视觉就露出了根本性短板——它看不到接触面之间正在发生什么。
DECO的出发点很务实:不同模态在动作生成中的角色是不同的。图像告诉模型场景和物体在哪;本体状态提供机器人自身姿态;触觉则补充接触和受力信息。如果把这三类信号粗暴拼在一起,触觉很可能被视觉和动作token淹没——它本身信号就稀疏,在注意力机制中很难争取到足够权重。但如果为了加入触觉而重新训练整个策略,成本又太高。
如何在“不推倒重来”的前提下,让触觉真正发挥作用?这正是DECO要回答的问题。
二、解耦式多模态扩散Transformer:各走各的路
DECO的核心架构设计可以用一句话概括:视觉、动作、关节状态和触觉信号分路径注入,而非一锅炖。
整个模型建立在扩散Transformer之上,但关键创新在于解耦式多模态融合设计。它没有把所有模态的token拼成一个序列喂给同一个注意力层,而是为不同模态设计了差异化的信息通路。视觉token负责场景理解,关节状态token负责本体感知,动作token负责执行输出,而触觉token则通过一条独立的注入路径进入网络。
这种设计的直接好处是:每个模态都能在自己的信息路径上保持足够的“话语权”,不会被其他模态稀释。但解耦只是第一步——更巧妙的设计在训练范式上。
![]()
三、两阶段训练:先学会“看”,再学会“摸”
DECO采用了一个先训视觉动作策略,再插入触觉适配器的两阶段训练范式。
第一阶段:训练vision-action policy。用双目图像、关节状态和任务条件学习动作生成。这个阶段不涉及任何触觉数据,策略学会的是“看着做”——识别场景、规划动作、生成轨迹。
第二阶段:冻结预训练策略,只训练轻量触觉适配器。触觉信号通过cross attention被注入到冻结的模型中。这意味着触觉成为一个可插拔的能力模块:已有视觉策略不必完全重训,只需训练少量参数,就能变成tactile-aware policy。
这个设计的工程吸引力是巨大的。在工业部署中,视觉策略往往已经经过了大量训练和验证。DECO的范式意味着:你不需要为了加触觉而放弃已有的视觉策略资产,只需要“插上”一个适配器。这大幅降低了触觉集成的时间成本和计算成本。
![]()
四、DECO-50数据集:4类场景28个子任务,区分“真需要触觉”和“不需要”
为了系统验证触觉的真实价值,论文同时发布了DECO-50数据集:4个双手灵巧操作场景、28个子任务、超过50小时数据、约500万帧、8000条成功轨迹。
任务分为四类:Pick-and-Place、Material Sorting、Waste Disposal和Assembly。
这个设计的精妙之处在于任务类型的刻意分层。Pick-and-Place和Material Sorting主要依赖视觉和本体状态;Waste Disposal需要开盖、投放、关盖,Assembly需要保持插接姿态和接触力——后两类任务对接触感知的依赖显著更高。
这种分层让研究者可以明确回答一个问题:哪些任务真的需要触觉?哪些只是“加了触觉也不一定更划算”?
![]()
五、结果:接触密集任务提升20个百分点
在四类真实机器人任务上,实验结果给出了清晰的答案。
DECO不加触觉时,平均成功率达到72.25%,已经比基线高出21个百分点——这说明解耦式多模态设计本身就有价值。
加入插件触觉适配器后(DECO.p),平均成功率进一步提升到82.50%。
但真正说明问题的,是接触密集任务的对比。Waste Disposal和Assembly两项的平均成功率,从DECO的53.13%提升到DECO.p的73.13%,提升了整整20个百分点。相比之下,ACT和DP基线在这两项任务上的平均成功率分别只有19.38%和28.13%。
触觉的价值不是均匀分布的——它恰恰在最需要“确认接触”的任务中发挥了最大的作用。在Pick-and-Place这类视觉主导任务中,触觉的提升有限;在需要开盖、插接、压紧的接触密集任务中,触觉从“可选”变成了“必需”。
六、为什么触觉有效:它补的是“看不到的状态”
论文的可视化案例揭示了一个典型失败模式:视觉策略误以为任务已经完成,于是提前撤手。盖子看起来已经关闭,插头看起来已经对齐——但“看起来”和“实际上”之间存在一道视觉无法跨越的鸿沟。
触觉信号能检测接触是否真正建立、力是否足够、物体是否在滑动。当机器人手指压紧盖子时,触觉传感器能感知到接触力的实时变化;当插头逐渐进入插孔时,触觉能捕捉到接触面积的扩大和摩擦的变化。这些信息不是“更好的视觉”,而是完全不同的物理量——它们来自接触面,而非来自光线。
DECO的核心结论因此显得格外清醒:触觉不是所有任务都需要,但它补的是视觉永远看不到的那层物理真实。
七、边界与代价:触觉不是免费的
DECO.p只需训练7.97M参数,不到整体模型参数的10%——这在工程上很有吸引力。但论文也没有回避成本。
触觉采集、传感器标定和真实机器人部署仍然有不可忽略的工程开销。触觉数据的获取需要物理接触,无法像视觉数据那样从互联网上“抓取”。此外,复杂长程任务的优化空间依然存在——DECO验证的四类任务虽然涵盖了核心场景,但距离开放的、多阶段的家务操作仍有距离。
更重要的是,触觉适配器的性能取决于触觉传感器的质量和一致性。如果不同机器人上的触觉传感器输出差异很大,适配器的泛化能力就会打折扣。这也是触觉感知需要走向标准化的重要原因。
八、结语:从“看着会做”到“真的接触到位”
DECO的价值,不只是“加入触觉后成功率更高”这个结果,更在于它提出了一条清晰的系统路线:当视觉策略已经具备基础操作能力时,用解耦注入和插件适配器把触觉补到最需要的接触环节,而不是推倒重来。
这种“可插拔触觉”的设计哲学,对正在走向产业化的具身智能有直接的启示意义。在真实部署中,视觉策略往往是宝贵的资产——经过大量数据训练、反复验证、逐步迭代。DECO的范式意味着,触觉能力可以作为一种“升级包”,在保留已有资产的基础上增量添加。
对双手机器人来说,这可能正是从“看起来会做”走向“真的接触到位”的关键一步。视觉让机器人知道该做什么,触觉让它确认做得对不对。两者不是竞争关系,而是操作智能的一体两面。
论文信息
标题:DECO: Decoupled Multimodal Diffusion Transformer for Bimanual Dexterous Manipulation with a Plugin Tactile Adapter
作者:Xukun Li, Yu Sun, Lei Zhang, Bosheng Huang, Yibo Peng, Yuan Meng, Haojun Jiang, Shaoxuan Xie, Guocai Yao, Alois Knoll, Zhenshan Bing, Xinlong Wang, Zhenguo Sun
单位:北京通用人工智能研究院、慕尼黑工业大学、中国科学院大学、清华大学、南京大学
发表:ICML 2026
论文:https://arxiv.org/abs/2602.05513v2
项目:https://baai-humanoid.github.io/DECO-webpage/
代码:https://github.com/BAAI-Humanoid/DECO
数据集:https://huggingface.co/datasets/BAAI-Humanoid/DECO-50
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.