网易首页 > 网易号 > 正文 申请入驻

李飞飞第一篇「触觉」论文:机器�...

0
分享至

来源:市场资讯

(来源:纪源资本)

https://forms.gle/bb9Dr734BdWR8FSS6

小纪有话说:

具身智能学术圈,可能是第一次迎来如此全明星阵营。


李飞飞,ImageNet奠基人,美国三院院士;

Trevor Darrell,伯克利BAIR联合创始人,他的Caffe深度学习框架曾是计算机视觉领域最广泛使用的平台之一;

Jitendra Malik,R-CNN的核心贡献者之一,深刻影响了计算机视觉的发展轨迹,同样是美国三院院士;

Pieter Abbeel,深度强化学习先驱,伯克利机器人学习实验室主任、BAIR实验室联合主任,ACM计算奖得主;

Ken Goldberg,机器人学泰斗,30年前就深耕机器人抓取和自动化,IEEE会士;

Jim Fan,英伟达GEAR实验室掌舵者,具身智能领域最受瞩目的年轻学者之一。

有模型的、算力的、本体的、数据的等等……在各自细分赛道上如雷贯耳的big name们,齐聚具身智能,但关注点嘛~一下就让人好奇起来:

不是当下大热的机器人通用大脑,而是——灵巧手。

贾浩楠 发自 凹非寺

量子位 | 公众号 QbitAI


T-Rex从何而起,

要解决什么问题?

自动驾驶靠纯视觉,是有可能解决问题的,但机器人,尤其是灵巧手却很难。

这是一个直观且浅显的事实:

手指、手掌进行精密复杂操作时,很难只用摄像头记录运动数据。

360°无死角的视频数据量有多庞大暂且不说,首先机位就没法布置。不同任务类别,很难像自动驾驶那样形成标准化数据集——模型泛化性受限。

自然而然,给模型加入触觉这个数据模态,就成了一石三鸟的方法:感知精度更高、操作更精准细腻,以及可以形成较为标准的数据集。


但反常识的事情出现了:

同样的灵巧手、同样的任务,T-Rex团队把触觉力信号直接拼接到一个预训练好的VLA模型里,想给它“加点手感”——结果任务成功率从17%掉到了6%。

触觉不是想加就能加的,论文把原因拆成了三层。

第一层,数据太贵。现有的大规模机器人数据集主要面向平行夹爪——两根手指一捏一放,遥操作门槛低。但灵巧手有22个自由度,操作员要戴数据手套,每一个手势都要精确映射到机械手上,还要保证视觉、触觉、关节状态严格对齐,目前灵巧手遥操作成本是平行夹爪的5到10倍。

第二层,频率对不上。视觉模型处理一帧图像动辄几百毫秒,只能跑到5到10Hz。但触觉反应需要毫秒级,20Hz以上才能捕捉到“正在滑”和“已经滑了”的临界点。

两种信号塞进同一个低频Transformer,视觉来不及看,触觉来不及反应。


第三层,表征太浅。很多方法把触觉当成一个静态的数字——“当前压力5牛顿”。但触觉本质是时序信号:滑动、插入、按压、搓动,每种接触状态都有“力随时间变化”的独特模式。

好,问题在这里,先看看T-Rex团队解决得怎么样。

在12项真实世界的灵巧操作任务上,T-Rex平均成功率达到65%,比最强纯视觉基线的35%高出了30个百分点。

翻书页96%对68%,开锁70%对0%——纯视觉方案在这个任务上完全被碾压。

消融实验更直接:把T-Rex的触觉输入全部拿掉,成功率从65%掉到42%,降了23个百分点——12项任务里超过三分之一的有效操作纯靠“手感”撑着。

数据效率也很惊人:仅给10条微调演示时,经过中期训练的T-Rex能达到约40%成功率,没经过中期训练的模型直接归零。

这说明模型不是“背下了”数据,而是真正理解了“搓”“捏”“拧”这些动作的通用手感。

一句话总结:视觉数据对灵巧手来说,本质上是不够用的——触觉不是锦上添花,而是必选项。

谁先解决“触觉怎么加”的架构问题,谁就可能在灵巧手这个赛道上卡住位置。


怎么做到的?

T-Rex的核心思路并不复杂——给触觉单独开一条高速通路,而不是让它和视觉挤在同一条慢车道上。

整体架构叫Mixture-of-Transformer-Experts,三个专家分工明确。


Latent Expert处理视觉和语言,预测未来的视觉表征,相当于给模型提供一个“接下来会发生什么”的大局感。

Action Expert做低频动作规划,参数量1.41B,是三个专家里最大的那个,跑一次管一个动作块。

Tactile Expert做高频触觉精修,参数量只有0.62B,轻量到可以频繁触发。

关键机制是Cascaded Flow Matching:

扩散去噪通常需要10步才能从一团随机噪声变成一个干净的动作轨迹,而T-Rex在第4步处一切两半:

前6步由Action Expert完成,生成一个“大方向对了但缺乏手感细节”的半成品;后4步由Tactile Expert接手,注入实时触觉数据完成精修。

为什么是第4步?作者团队通过实验对比发现太早切,Action Expert去噪步数太少,继承不了大规模人类视频预训练获得的先验知识;太晚切,动作分布已经定型,触觉信号进来也来不及修正了。


第4步刚好处在“该有的形状都有了,但细节还能改”的黄金位置。

这就像写文章:主编(Action Expert)定好大框架后就去忙别的了,四个编辑(Tactile Expert)在不同的节点上轮番检查细节,不需要主编每次都回来重看一遍全文。

触觉信号怎么编码是另一个关键设计。

触觉传感器有零点漂移和高频噪声,直接拿原始电压值喂给模型,模型很可能把传感器噪声当成接触特征学进去。

T-Rex用VQ-VAE把过去16帧(约0.5秒)的力历史压缩成64个离散码字。不同接触状态——按压、插入、滑动——会被自动聚类到不同的码字上。

这样一来,传感器漂移被过滤掉了,触觉信号还变得可解释——你能看到模型“理解”了什么类型的接触。


两个工程细节,第一个:让码本“活起来”。VQ-VAE码本,理训练时经常出现“码本坍塌”——大部分抽屉空着,少数几个塞满各种杂乱状态。T-Rex的做法是定期检查哪些抽屉闲置,主动塞点数据进去“激活”它,确保所有码字都被利用起来。

第二个,给“有手感”的时刻更高权重。避免模型化90%的精力去学好“零接触”这个最容易学的状态,而忽略真正有价值的接触瞬间。T-Rex给高力帧更高的学习权重,让模型把算力集中在关键接触点上。

论文正文不会写、但做灵巧手工程化的人一看就懂。

最后是训练策略。

T-Rex采用三阶段训练:

先在大规模人类视频上预训练(22,889小时),让模型看懂“人是怎么动的”;

再用100小时遥操作数据做中期训练,覆盖207种物体和22种动作基元——目的是把人类视频里的运动知识迁移到机器人本体上,而不是死磕某个具体任务。

最后用约100条任务演示做后训练,快速适配特定需求。


其中最核心是中期训练,解决了一个根本问题:人手抓杯子的方式和机械手抓杯子的方式不一样,策略不一样,受力反馈也不一样。如果直接拿人类视频训练出来的模型去操控机器人,它不知道怎么把“看来的”转化成“做出来的”。

中期训练就是用100小时的遥操作数据,把这道鸿沟填上。它不是让模型死磕某一个具体任务,而是让模型接触207种物体和22种动作基元的组合,理解“搓”这个动作在不同物体上应该怎么执行、“捏”这个动作需要多大的力。

这就像一个人学完游泳理论后,在浅水区把蛙泳、自由泳、仰泳都练了一遍——不追求速度,只追求“会用”。

有了这个基础,最后阶段只用100条任务演示就能快速适配——因为模型已经知道“手感”是什么了,只需要知道“用在哪儿”。

T-Rex的技术路线清晰指向一个判断——视觉和触觉在灵巧操作中不是主从关系,而是并行关系。

它用一个异步架构解决了频率不匹配的底层矛盾,用一套时序编码把漂移的传感器信号变成了可解释的离散词汇,用一组基元组合的覆盖策略替代了特定任务的深度堆叠。

这三件事单看都不是“发明新数学”,但组合在一起,为灵巧手的触觉利用提供了一套可复用的系统方案。


灵巧手,

存在一个“第一性原理”吗?

灵巧手赛道眼下最热闹的争论,集中在两个地方:关节运动形式和自由度数量。

腱绳还是连杆?丝杠还是齿轮?11个自由度够用还是得干到27个?不同厂商各执一词,技术路线远未收敛。

这些争论当然都有意义——传动方案决定成本、可靠性和使用寿命,自由度决定灵巧程度的上限——但学术前沿的核心关注,不在这些问题中的任何一个上面。

因为一个更深层的问题很少被讨论:有了这些硬件,算法能不能用好?

传统大模型范式几乎以视觉数据为主,没有针对触觉模态的有效利用方案。T-Rex论文里那个17%掉到6%的实验,恰好说明了这一点——不是触觉没用,是现有多模态大模型架构消化不了触觉。


T-Rex团队的探索最大价值可能在这里:跳出硬件参数的争论,回到一个更根本的问题——灵巧手做精细操作,到底需要什么数据?

关节形式和自由度数量解决的是“能不能动”的问题,触觉数据解决的是“能不能感知和反应”的问题,由此衍生出“需要什么样的触觉数据”这个体系化问题,并给出了一个能泛化的方案。

当然,T-Rex这项研究得以完成,一个关键前提是Sharpa Wave提供的硬件基础——22个自由度、180Hz高频触觉信号、稳定的传感器输出。

灵巧手的硬件天花板顶高了,T-Rex才得以在算法层面去够这个上限。

反过来,T-Rex的算法探索也给硬件提出了新要求:手掌区域需要触觉感知,不同传感器的数据格式需要统一。

T-Rex的软件、SHARPA的硬件探索方向,后续可能会给这个细分领域带来更深刻的变化。

首先灵巧手可能从具身智能本体中分化出来,成为一个独立赛道——占整机成本15%到20%,经济上可行,技术上门槛也足够高。


但如果触觉数据成为核心壁垒,灵巧手就不仅仅是执行器,而是整个“感知-决策-执行”链条中数据价值最高的一环。谁掌握触觉数据的采集能力和模型训练能力,谁就掌握了议价权。

第二个变化,更多专用场景的具身应用可能被启发。当前具身智能的主流叙事是“通用”——一个模型解决所有任务。

但这个叙事在接触密集型任务上遇到了困难,因为通用数据里触觉是缺失的。

T-Rex则证明的是另一种可能性:在一个足够具体的垂直场景里,用专用的数据模态(触觉)、专用的架构设计(异步级联)、专用的数据收集策略(基元×物体),可以取得比“通用”方案好得多的效果。

这条路径如果走通,会启发更多人去寻找类似的高价值专用场景。

T-Rex的贡献不是发明了“新数学”,而是把现有工具组合成一套可用的系统方案,试图建立具身智能触觉数据统一的采集、训练范式,推动灵巧手真正scale up起来。

*项目地址:https://tactile-reactive-dexterous.github.io/

作者简介:牛丹彤,UC Berkeley PhD Candidate,NVIDIA Gear Lab实习生,导师Trevor Darrell,主要从事具身灵巧手大模型的研究,曾以第一作者或共同第一作者身份在CVPR, ICML, ICLR等国际顶级会议上发表论文8篇,领导或主要贡献T-Rex,EgoScale等工作,目前谷歌学术引用1100+。

刘卓洋,北京大学元培学院本科生,导师仉尚航,目前在UC Berkeley访问,导师Trevor Darrell,主要从事具身多模态推理大模型方向的研究,曾以第一作者或共同第一作者身份在ICML, ICLR, NeurIPS, ICRA等国际顶级会议上发表论文6篇,其他参与论文共计15篇,目前谷歌学术引用400余次。曾获2026商汤奖学金(全国30人),2025北京大学学术新星提名,北京大学元培学院年度科研奖励,北京大学新生奖学金等。

Trevor Darrell教授,最广为人知的成果是开发了Caffe深度学习库。这个库在深度学习领域具有重要的地位,为众多的研究人员和开发者提供了便捷的工具,极大地推动了深度学习技术的发展。

Trevor Darrell现在是加州大学伯克利分校Berkeley DeepDrive研究中心的主任。同时担任伯克利EECS系计算机科学分部的教职,并受聘于加州大学附属的国际计算机科学研究所(ICSI)。研究方向涵盖大规模感知学习算法,包括物体与行为识别及检测,并应用于机器人及移动设备的多模态交互等多种场景。他的研究兴趣包括计算机视觉、机器学习、计算机图形学以及基于感知的人机交互界面。

*头图及封面图来源于ivy

温馨提示:虽然我们每天都有推送,但最近有读者表示因平台推送规则调整,有时候看不到我们的文章~

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
拒绝1200万年薪!31岁朱婷续约意大利 一张通知让她无缘中国女排

拒绝1200万年薪!31岁朱婷续约意大利 一张通知让她无缘中国女排

念洲
2026-07-31 09:17:12
梅德韦杰夫:拯救俄罗斯只有一条路,打赢这场特别军事行动

梅德韦杰夫:拯救俄罗斯只有一条路,打赢这场特别军事行动

鲁中晨报
2026-07-30 20:26:06
Jennie新歌MV疑似露点,网友:是刻意的,热搜这不就上了

Jennie新歌MV疑似露点,网友:是刻意的,热搜这不就上了

陈意小可爱
2026-07-31 02:37:26
24小时内连炸三座“野莓”仓库,乌克兰要干什么?

24小时内连炸三座“野莓”仓库,乌克兰要干什么?

山河路口
2026-07-30 20:43:50
竹知了为什么会被大量投诉?我研究了半天也没搞懂原因

竹知了为什么会被大量投诉?我研究了半天也没搞懂原因

历史总在押韵
2026-07-30 23:22:19
“莫氏鸡煲”上综艺首轮被淘汰,录节目几天出场仅3分钟!谢霆锋点评:“鸡很好,汤很好喝”

“莫氏鸡煲”上综艺首轮被淘汰,录节目几天出场仅3分钟!谢霆锋点评:“鸡很好,汤很好喝”

每日经济新闻
2026-07-30 18:23:31
内塔尼亚胡与特朗普会谈现场曝光:内塔尼亚胡跷着二郎腿,姿态轻松,网友:仿佛在说一切尽在掌握中,而他可能确实如此

内塔尼亚胡与特朗普会谈现场曝光:内塔尼亚胡跷着二郎腿,姿态轻松,网友:仿佛在说一切尽在掌握中,而他可能确实如此

极目新闻
2026-07-31 10:16:07
世界上最严重错误工程?耗费巨额资金,建成一笔烂账!中国占两个

世界上最严重错误工程?耗费巨额资金,建成一笔烂账!中国占两个

混沌录
2026-07-30 22:35:07
4小时搞定1笔转会!皇马官宣21岁前锋加盟:穆帅钦点 西甲25场11球

4小时搞定1笔转会!皇马官宣21岁前锋加盟:穆帅钦点 西甲25场11球

风过乡
2026-07-31 05:46:48
残暴至极!拜仁15-0狂胜第9级别鱼腩:近4场交锋轰79球 对手笑开花

残暴至极!拜仁15-0狂胜第9级别鱼腩:近4场交锋轰79球 对手笑开花

风过乡
2026-07-31 06:16:37
极目深度 对话38岁考上北大的清华毕业生李龙:不后悔20年前没选择学医,羡慕王虹能做自己真正热爱的事情

极目深度 对话38岁考上北大的清华毕业生李龙:不后悔20年前没选择学医,羡慕王虹能做自己真正热爱的事情

极目新闻
2026-07-30 15:36:52
中国生产线被拆除之后,美国向印尼放话:我们和日本也没法投资,因为你们的产业不达标,根本不符合要求

中国生产线被拆除之后,美国向印尼放话:我们和日本也没法投资,因为你们的产业不达标,根本不符合要求

人生录
2026-07-31 00:05:13
欧洲足联55国达成一致:将抵制世界杯,抗议FIFA向私人投资出售赛事股权

欧洲足联55国达成一致:将抵制世界杯,抗议FIFA向私人投资出售赛事股权

竞技风云录
2026-07-31 00:05:20
欧足联抵制!接下来会发生什么?世界杯大幅贬值+FIFA名存实亡

欧足联抵制!接下来会发生什么?世界杯大幅贬值+FIFA名存实亡

全景体育V
2026-07-31 09:42:39
中国课本上的“假历史”,骗了国人千百年,至今仍有人深信不疑

中国课本上的“假历史”,骗了国人千百年,至今仍有人深信不疑

长风文史
2026-07-28 20:27:05
据报道,特斯拉考虑剥离中国业务,为潜在与SpaceX合并铺路

据报道,特斯拉考虑剥离中国业务,为潜在与SpaceX合并铺路

财闻
2026-07-31 09:20:19
2026年质量督察首批督察组全部实现督察进驻

2026年质量督察首批督察组全部实现督察进驻

界面新闻
2026-07-31 11:04:54
27岁姆巴佩拿下西班牙女神,身价过亿,实力才是硬通货

27岁姆巴佩拿下西班牙女神,身价过亿,实力才是硬通货

小椰的奶奶
2026-07-31 00:50:27
韩红名场面被扒!直播紧急叫停,她透露将赴鲁院进修,主持人连忙提醒:还没正式批复

韩红名场面被扒!直播紧急叫停,她透露将赴鲁院进修,主持人连忙提醒:还没正式批复

火山詩话
2026-07-31 06:57:21
0-7惨败!董路嘴硬:开大脚是中国足球方向 在亚洲我们身高有优势

0-7惨败!董路嘴硬:开大脚是中国足球方向 在亚洲我们身高有优势

念洲
2026-07-31 09:16:22
2026-07-31 11:28:49
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4272260文章数 9095关注度
往期回顾 全部

科技要闻

苹果财报亮眼:产品卖得太好 芯片开始不够

头条要闻

龙正才被查 曾在问政节目公开承认公车私用:见怪不怪

头条要闻

龙正才被查 曾在问政节目公开承认公车私用:见怪不怪

体育要闻

曝皇马将签罗德里!转会费6000万签约4年

娱乐要闻

李小璐澄清夜宿门,被网友质疑想洗白

财经要闻

打新日确认!宇树科技IPO冲刺“冰与火”

汽车要闻

FREELANDER神行者8下线 8月10日开启预售/海外版同步推进

态度原创

艺术
家居
数码
本地
公开课

艺术要闻

奇瑞上海总部大楼的“伤疤”火了,号称空中社区!

家居要闻

2026建博会(广州) 公装联探展交流活动

数码要闻

延迟大降8ns!微星新增BIOS高效模式:标准内存跑出顶级ULL性能

本地新闻

神仙也“蓉”漂,哪吒与八仙,皆是成都出品!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版