![]()
上触觉已经不是一个「yes or no」的问题,而是「when」的问题。
作者丨向 欣
编辑丨高景辉
瑞典科学家做过一个经典的实验:给受试者的手指尖注射麻醉剂,让他去完成一个再简单不过的动作:从火柴盒里取出一根火柴,然后划亮它。
正常情况下,这个动作几秒钟就能完成。但在手指失去触觉后,受试者的整个动作变得像提线木偶一样笨拙,取火柴时反复调整却拿不稳,划火柴时用力不均、方向歪斜,花了很长时间才勉强完成。
「这就是现在整个具身智能的现状。」纬钛机器人 CEO 李瑞说。
所谓现状是,当下的具身智能拥有越来越聪明的「大脑」和越来越灵活的「肢体」,但唯独缺了触觉反馈,就像手指打了麻醉剂的人,能看见、能动作,却很难做好需要精细感知的操作。
要改变这种状况,关键在于让机器人拥有「接触智能」:让机器人以接近人类的方式理解「接触」的本质,不仅能感知物体的存在,更能根据接触反馈实时调整动作、控制力度并稳定执行。
在李瑞看来,具身智能仅靠视觉很容易到达天花板,下一步必须加上触觉。在人能做的 90% 以上的任务中,都需要触觉参与。上触觉已经不是一个「yes or no」的问题,而是「when」的问题。
这一点与黄仁勋的判断一致。黄仁勋今年开始多次强调,触觉是机器人进入物理世界的最后一块拼图。
而李瑞本人,正是这块拼图关键的参与者,也是视触觉这个技术路线最早的缔造者之一。2011 年,他在 MIT 读博期间与导师共同开创了机器人视触觉传感器这一领域,2014 年做出了全球第一款分辨率超越人类手指的视触觉传感器。在这个领域深耕十几年后,他于 2024 年创立纬钛机器人,聚焦视触觉传感器和灵巧操作,也成为小米的合作方。
不少从业者的共识是,触觉传感器正处在爆发前夜。李瑞判断,上半年是触觉传感器在灵巧手领域规模化落地的起步期,下半年,随着搭载触觉的灵巧手批量出货,数采设备铺开,触觉传感器就会进入实质性爆发阶段。
纬钛的定位是「触觉领域的英伟达」,不只是一颗传感器,而是涵盖传感器、数采设备、VTLA 大模型和世界模型的物理AI基础设施。「这个领域是我们开创的,也是我们在引领的。」
「最后一块拼图」正在从论文里的概念变成灵巧手上的零件。这块拼图怎么拼、拼到了哪一步?在众多触觉传感器的技术路线中,视触觉的技术壁垒究竟有多深?带着这些问题,我们和李瑞聊了聊。
01
仅靠视觉,就像手部打了麻醉剂
▎AI 科技评论:产业界对触觉的追捧是今年才开始的,而你在这个领域已经做了十几年。当时为什么会选择研究触觉?
李瑞:我从 2005 年本科时就开始做机器人和计算机视觉,在做很多操作时就发现仅仅依靠视觉远远不够。我喜欢从第一性原理去思考,人在做很多操作时需要手眼协同。要真正实现「心灵手巧」,「心灵」代表聪明的大脑,「手巧」不只关乎自由度,更核心的是触觉反馈。但在当时,市面上没有一个好的触觉传感器,有的只能提供单点信息,跟人手差太远了。所以 2011 年我在 MIT 读博时,就开始做视触觉传感器,这个领域是我和当时的导师共同开创的。
现在大家都在说 VLA、说世界模型,说的都只是视觉。但仅仅依靠视觉完全不够,必须把触觉信息结合上去。
▎AI 科技评论:在触觉传感器受到关注之前,业界也有用「力反馈」和电流方案来控制抓取,这些方案不能替代触觉传感器吗?
李瑞:之前大多数方案本质上是位置控制,夹爪盲目地到达一个预设位置,但到达之后操作有没有做好,它其实不知道,没有反馈。电流方案提供的也是非常粗糙的单向力信息,不是触觉。力反馈通常指的是手腕、胳膊这些部位的力,而手指尖上是缺失的。
▎AI 科技评论:那真正的触觉传感器能提供什么信息?
李瑞: 两大类信息。第一类是物体的物理属性,表面纹理、软硬程度、形状大小;第二类是接触的状态,法向力、切向力、滑动等。有了这些反馈,机器人才能知道有没有把物体捏牢、捏准。
▎AI 科技评论:之前特斯拉展示过灵巧手夹鸡蛋,那种程度的操作是否已经用到了触觉?
李瑞:他用了一种触觉传感器,但比较简单,没有切向力。没有切向力意味着夹了鸡蛋之后再去夹其他东西,力不太好自适应。
切向力本质上就是摩擦力。拿一瓶水时,用多大的力能拿起来而不滑动?拿鸡蛋时,多大的力不至于捏碎又拿稳?插拔 USB 时,人是靠摩擦力感知有没有插进去的。没有切向力,这些精巧操作都不好做。我们的视触觉比特斯拉前一代版本有更丰富的信息。
▎AI 科技评论:你 2011 年在 MIT 开创了视触觉这个方向。从那时到现在,这个领域在学术界经历了一个怎样的发展过程?
李瑞:第一个里程碑是 2014 年,我们把全球第一款超高分辨率视触觉传感器 GelSight 指尖传感器推向市场,分辨率超过人类手指。到 2019 年前后,视触觉引爆了整个学术圈。原因是 2012 年深度学习起来后,大家主要聚焦在视觉上,但到 2019 年发现视觉到了一个瓶颈,很多人开始转向视触觉。
那时候我们在行业里已积累多年,迄今实验室拿了非常多最佳论文奖,发表了 100 多篇论文。所以成立公司不是从零开始,前面有十几年的基础,可以快速进行产品化和迭代。
▎AI 科技评论:学术界认可视触觉后,它在产业端的渗透经历了怎样的变化?
李瑞:从 2024 年到现在经历了三个阶段。2024 年 8 月之前,大部分灵巧手公司都没有上触觉。那年 8 月的世界机器人大会上,有两家上了,强脑科技和因时机器人,当时先用的是电容方案。但经过一年,他们开始寻找其他方案。某头部灵巧手公司从去年下半年就跟我们合作,今年 4 月发布的第三代灵巧手,用的就是我们的触觉传感器,已经批量使用。另外还有多家头部灵巧手公司也在跟我们合作。
▎AI 科技评论:他们当时为什么从电容方案转向视触觉?核心差距在哪?
李瑞:传统触觉传感器分辨率不够高,每平方厘米可能只有几十个点,而我们可以达到几万个到几十万个点。压阻、电容、霍尔这些阵列式传感器,需要铺很多点,每一个都要做得很小,但物理结构决定了密度上不去。分辨率高了以后,对很多操作来说能提供非常丰富的信息。还有一点很关键,切向力对于灵巧操作非常重要,视触觉可以提供非常灵敏的切向力,而传统阵列式的传感器通常只有法向力,难以提供切向力,比如摩擦力就是一种切向力,对于抓取和插拔类的任务非常关键,可以帮助快速闭环。我现在看到的是行业正在向视触觉收敛,对很多头部灵巧手公司来说,上不上触觉已经不是「yes or no」的问题,而是「when」的问题。
02
摄像头分辨率,就是触觉分辨率
▎AI 科技评论:视触觉为什么能突破传统阵列式传感器的密度限制?
李瑞:视触觉的技术是从人的手指得到灵感的,手指接触物体时发生形变,通过神经末梢传递信号。我们用弹性体模拟皮肤,发生形变后由后面的微型摄像头捕捉形变,再通过算法算出触觉信息,包括法向力和切向力。
关键是,摄像头有多高分辨率,触觉传感器就可以有多高分辨率。我们巧妙地把触觉信息转化为图像信息,再反推触觉信息,所以叫「基于视觉的触觉传感器」,简称视触觉。
▎AI 科技评论:也就是说,触觉信息点的密度本质上取决于摄像头分辨率,而不是传感器阵列的数量?
李瑞:对。比如说 640×480 就有 30 万个像素点,每一个对应一个触觉信息点。如果这块传感器面积是 3 平方厘米,每平方厘米就是10万个信息点。
▎AI 科技评论:除了力和形变信息,视触觉传感器还能采集哪些维度的数据?
李瑞:触觉信息以图像形式呈现,包括法向力、切向力滑动信息等,分辨率非常高。识别不同材质,也是因为分辨率高,弹性体能捕捉到非常丰富的表面信息。另外还有物体在手中的位姿信息。这些信息可以用来进行精准回放,适配不同的机器人。
▎AI 科技评论:相比压阻、电容、霍尔这些传统路线,视触觉的整体技术优势体现在哪里?
李瑞:四个优势。第一,超高分辨率,视触觉的分辨率可以达到传统触觉传感器的成千上万倍。第二,多维力探测能力,法向力、切向力、滑动信息都能测。第三,可以进行柔性物体操作,比如衣服、线缆、食物。第四,不容易受环境干扰,压阻、电容容易受温湿度影响,霍尔效应容易受电磁场干扰,而视触觉不太容易受这些影响。
▎AI 科技评论:同样是视触觉路线,业内也有多色光和单色光的分歧。这背后的技术差异是什么?
李瑞:学术界主流就是多色光,是因为多色光相对于单色光有很多优势。比如多色光的法向力和切向力是分开算的,两者分的特别清楚,法向力就是法向力,切向力就是切向力,准确度和分辨率都可以做到很高。而单色光牺牲掉了颜色,得到的只是一个合力,无法有效分析法向力和切向力,比如合力是 5,你没办法区分到底是什么组合得到的,理论上有无限多种可能,比如是5和0,还是垂直方向的3和4,以及哪个方向是 3、哪个方向是 4,需要靠猜,所以准确性容易有很大问题。而且单色光非常容易产生畸变,每次按压得到的信息可能不一样,有一致性问题。一致性对机器人操作很重要,对于数采和模型训练可能会有很大影响。另外,之前有人说的所谓的功耗、算力、耐久性等等这些跟多色光和单色光没有任何关系,而是看每家的能力能做到什么程度,不要被一些网上的恶意引导所误导。
▎AI 科技评论:这些技术优势在产品化过程中是怎么实现的?你们的第一款标品 GF225 相比学术版本有哪些提升?
李瑞:GF225 相比学术界的 GelSight Mini 有全方位性能提升,耐久性从千次级别提升到 500 万次以上,提升了数千倍。这使它可以在工业、商业等场景中实际使用。比如我们跟小米的合作,开始用的就是 GF225 标品。
后来推出了用在两指夹爪上的 GF220,更轻、更薄、更小,可以运用在更狭小的空间。我们甚至还有更小的版本,后续会推出。
另外是用在灵巧手上的 GF515,今年 3 月在 AWE 上发布,是全球首个超小尺寸、超高分辨率、超高频率的视触觉传感器。每平方厘米上万个触觉信息点,最高频率 120 赫兹,可以做到急速响应、低延迟。
03
如果我们踩了 10 个坑,
别人可能要踩 100 个
▎AI 科技评论:不少拥有学术背景的创业者,在产业落地时都会遭遇技术与量产脱节的难题,从学术界到产业界,你感受最深的变化是什么?
李瑞: 学术界追求创新性和性能极致,产业界关注耐久性、稳定性、一致性。比如学术界的 GelSight Mini 可能只做到 1000 次按压,我们要做到 500 万次以上。学术界只关注单个传感器,但我们要关注几千个、几万个传感器是否有足够的一致性,以及量产能力。
▎AI 科技评论:很多学术背景的创业者都在量产工程化上翻过车。你们是怎么处理这个问题的?
李瑞: 量产和产品化有很大 gap。我们从最早的原型到第一个产业化版本,中间经历了十几年,即使如此依然踩了很多坑。如果我们踩了 10 个坑,别人没有这十几年的积累,可能踩 100 个甚至 500 个。
很多细节不会写到论文里,弹性体用什么工艺、结构怎么设计、算法哪个参数怎么调,硬件、软件、算法是一个整体。不是读几篇论文、手搓一个原型就可以的。
▎AI 科技评论:很多模型厂商反映触觉传感器的数据太丰富了,接入训练体系时很容易混乱。这个问题你们是怎么处理的?
李瑞: 这恰恰是视触觉的优势。视触觉背后是摄像头,数据以图像形式呈现,和视觉模态本质一样,在架构设计时比其他类型更有优势。而且丰富的信息在大模型时代优势更大,模型能捕捉到更多信息,进行更精细的泛化操作。最近李飞飞的 T-Rex 论文就讲了触觉和视觉融合,比纯视觉有大幅提升。
▎AI 科技评论:视触觉数据本质上是视频、图像数据,很难大幅度压缩,有人用视触觉传感器采集了一小时数据,就采集了十几 G 的数据,这意味着视触觉技术对算力资源和存储空间要求很高。这会成为视触觉传感器应用的瓶颈吗?
李瑞: 不会。我们不需要全分辨率,240×240 就够了,甚至 120×120 也行。每个手指 240×240,五个手指加起来比一个 640×480 的摄像头还少。
▎AI 科技评论:你们既做传感器,也做数采设备,还有自己的模型。纬钛未来的定位是什么?
李瑞: 我们做 VTLA 和世界模型,方向是全栈,模型、采集、硬件都做,而且一定要把触觉结合进去。我们的定位是「物理AI基础设施」、「触觉版的英伟达」。这个领域是我们开创的,也是我们在引领的。搭载在五指灵巧手上的视触觉传感器,目前市面上能批量出货的,只有我们一家。
▎AI 科技评论:你们是什么时候开始做数据采集设备的?
李瑞: 2025 年开始的。去年下半年 UMI(Universal Manipulation Interface,通用操控接口)比较火,但它只是纯视觉的,没有触觉。客户问能不能把触觉结合上去,所以我们做了带视触觉版的 UMI。
数据处理方面,清洗、标定都有做。采集的信息包括触觉图像、视觉信息、位姿信息等,可以精准回放,适配不同机器人。
今年7月我们刚和光轮智能签了战略合作,把触觉传感器接进他们的人类数据开放平台,以后采集到的就不只是动作轨迹,还有接触位置、形变、滑移这些触觉信息。
另外今年1月我们跟国地中心联合发布了“白虎-VTouch”数据集,目前下载量已经超过百万次,正在给具身智能补上缺的那块触觉数据拼图。
▎AI 科技评论:灵巧手公司会对传感器提出哪些要求?成本会不会是大规模覆盖的障碍?
李瑞: 不同灵巧手有不同尺寸和性能要求,定制适配一般要求至少百台以上。今年很多灵巧手公司可能几千只手都会用上触觉传感器,一只手 5 个的话量就更大了。
成本不是最关键的,最关键的是能不能达到功能要求,达不到要求再便宜也没用。成本是相对的,早期很多东西需要机加工,一旦开模批量生产,成本就可以降下来。
▎AI 科技评论:纬钛现在的商业化进展如何?触觉传感器市场什么时候会迎来真正的爆发?
李瑞: 非常好。今年就是视触觉爆发的元年,订单和客户需求巨大增长,根据客户反馈我们是市面上唯一一家五指版本搭载灵巧手可以批量出货的。上半年是爆发前夜,下半年就是要爆发的。今年很多灵巧手会搭载视触觉形成实质性落地,数采设备、整机执行器都会有视触觉和手眼协同,我们在视触觉的多个方面排在第一位。
上车,带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲PPT
大会报告全文
热门论文解读
学术新星访谈
未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!
公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.