![]()
无本体数据跑通复杂长程任务的时刻,到了。
作者丨向 欣
编辑丨高景辉
最近,自变量机器人发了一段Demo。看完之后我们的感觉是:无本体数据路线要迎来一个重要的里程碑 了 。
画面里,一个机器人独立完成了开瓶取样、滴管操作、玻璃棒引流、混合摇匀,24个子动作,一镜到底做完了整场化学实验。
这里的重点是,用于训练它的数据,只有数百条,而且全部都是无本体数据,没有一条来自机器人真机。
![]()
也就是说,自变量只用极少的无本体数据,就让机器人学会了需要精准力控和双手协同的长程操作。
视频背后的系统是自变量最新发布的TwinDEX,它由一套可穿戴的无本体数据采集系统和一套与之匹配的机器人末端执行器组成,中间配套完整的数据处理和策略训练流程。
评测显示,TwinDEX训练模型时无本体数据近乎可 100% 完全替代真机遥操作数据。
其中含金量不言而喻,机器人越是追求精细、复杂的灵巧操作,对训练数据的质量和规模要求就越高。
过去几年,灵巧操作被公认是具身智能里最难啃的一块骨头。而数据采集始终面临两难:遥操作虽然采出来的数据和机器人本体天然匹配,但成本高、速度慢,规模化极难;用视频、手套等轻量方式采集人类示范虽然能把成本压下来,却又绕不开一个老问题:人采到的东西,和机器人真正需要执行的动作常常对不上号。
这也塑造了具身智能领域的「数据金字塔」:真机遥操作数据因包含丰富的真实物理交互信息,被视为价值最高的数据类型,但同时也是最难规模化获取的数据。
TwinDEX则提供了另一种可能——通过提高数据采集端与机器人执行端的一致性,让无本体数据也能够获得接近真机数据的训练效果,为灵巧操作的数据规模化提供了新的方法。
而且,TwinDEX并不只是单纯地让采集端和执行端保持「同构性」,而是从「纯无本体数据训练」的目标出发,反向协同设计了硬件、训练和执行系统,让数据从产生之初就符合机器人执行需求,无需复杂迁移即可用于训练和部署,采集也摆脱了机器人本体和固定场地的限制。
这么看来,自变量是把数据采集的逻辑,重新定义了一遍。
01
24个动作一镜到底,
「最强」demo用了「最少」的数据
先看这套系统究竟让机器人做了什么。
这场实验包含24个子动作,流程大致经过开瓶取样、滴管与试管操作、玻璃棒引流、摇匀观察。
整段演示有三个关键词:长任务、双手协同、连续工具切换。此前行业里的灵巧手演示,多是抓起一个物体、放进一个盒子,动作链条短,容错空间大。
而这次自变量展示的是长程任务。长程任务的难点在误差累积:24个动作连成一条链,每一步都要求毫米级定位与稳定力控,任何一步的微小偏差都会被后续步骤放大,前一步歪一毫米,后面洒掉的可能就是半勺粉末。
能一镜走完,说明系统的闭环修正能力足够稳定,全程都没有崩。
其中几个动作尤其能说明这套系统的操作能力。
第一处难点是开瓶和取样。
旋开瓶盖这个动作的技术亮点在于旋拧依赖的是手指的侧摆自由度,而不是手腕旋转。
把瓶盖拧松再旋下,手指需要在接触瓶盖的同时产生侧向运动。人手旋盖时,拇指和食指形成对向接触,指腹与瓶盖之间的摩擦力提供旋转所需的切向力。
![]()
但机器人要复现这个动作,侧摆关节必须产生足够的位移和力矩,接触点要避免滑移,旋松过程中还要从强力抓握过渡到更柔性的控制。
很多灵巧手能握住瓶子,但没法让手指在保持接触的同时横向移动,这个差距,就是「能抓」和「能操作」之间的分界线。
药勺取粉则是另一个维度的难度。药勺柄细,瓶口窄,机械臂要把勺尖精准探入瓶内,舀取粉末后再平稳抽出,全程不能碰撞瓶口、不能洒落。狭窄空间里的精细定位、避障和稳定取料,三者叠加,对空间精度的要求极高。
![]()
药勺进入瓶口后,视觉基本被遮挡,后续操作依赖的是运动规划和接触感知。系统必须在缺乏持续观测的情况下完成精细接触操作,这在机器人领域属于难题。
第二处难点是滴管操作。
滴管需要经历抓取、挤压、出液和释放几个连续状态。位置偏差可以通过视觉判断,挤压力度却很难单靠图像确定。
这个任务真正难的地方在挤压环节。力度太小,液体排不出来;力度太大,液滴飞溅。滴管是弹性物体,挤压过程中的力反馈是非线性的,前半段和后半段的阻力完全不同。
![]()
这种情况下,力度控制不是靠位置规划能解决的,需要在接触发生后持续调节输出。机器人还要完成换手、取试管、倒液等连续操作。换手意味着两只手之间的协调配合,倒液涉及腕部姿态与液体流向之间的关系。灵巧操作真正的难点,正在于接触发生之后还要继续控制力。
第三处难点是玻璃棒引流。
一只手需要把透明玻璃棒压在烧杯内壁并保持位置,另一只手拿起水杯缓慢倾斜,让液体沿玻璃棒流入烧杯。
![]()
两个接触关系必须同时成立:玻璃棒与杯壁之间的接触,液流与棒面之间的接触。任何一侧的力或位置偏移,都会导致液体溢出。
仔细拆解这个动作。玻璃棒透明,视觉系统很难精确感知它的位置和姿态。机器人需要在视觉信息不完整的情况下,通过接触力来判断玻璃棒是否贴紧了杯壁、是否稳定。
倾倒的那只手则需要根据液流速度动态调节倾角,这个调节过程没有确定的公式可以套用,每一步都依赖对当前状态的实时评估。
两只手同时维持接触约束时,任何一只手的误差都会直接传导到另一只手。右手调整倾角时产生的力变化,通过烧杯传递到左手拿的玻璃棒上,如果左手的力控不够稳定,玻璃棒就会滑动。把这个动作做出来,比做十个抓取放置加起来都难。
回到这个Demo真正证明了什么,可以总结成三点。
其一,误差没有随任务变长而失控,说明闭环修正能力稳定,系统经得起长链条的考验。
其二,滴管挤压、玻璃棒引流这类动作,人类都要靠指尖的即时手感来调整,机器人做到了,说明触觉和力控信号真正被有效利用,模型没有在靠视觉盲操。
其三,也是最有说服力的一点:训练全程零真机数据。最难的任务完全由无本体数据撑了起来,等于给「同构采集」这套方法论做了一次最苛刻的压力测试。
可以说,这个Demo挑选的任务,属于最容易暴露问题、也最难伪装成功的那一类。任务越长,接触越多,工具切换越频繁,系统留下的容错空间就越小。能把这些环节连续完成,才足以说明它具备稳定的精细操作能力。
02
让数据与机器人完全匹配,
将迁移难题「扼杀在摇篮里」
要理解 TwinDEX,首先需要把它看成一套完整的数据系统,而非单独的一套硬件。它从一开始就是为纯无本体数据训练设计的,「同构」是核心设计原则,硬件形态、数据采集和训练方式都由这一目标倒推而来。
TwinDEX的优点可以概括为三个词:灵巧性、一致性、可拓展性。灵巧性是入场券,一致性是核心,可拓展性决定上限。
先说灵巧性。TwinDEX的三指灵巧手具备九自由度,其中七个为主动自由度。这个构型是克制的选择。自变量建立了覆盖多类元操作的灵巧性基准来评估构型,最后发现,拇指、食指和中指协同起来,已经能覆盖大多数常见操作,既能配合足够好的模型,也可以完成复杂的灵巧操作。
![]()
一致性是重点,体现在三个层面。
第一个层面,是数采硬件与机器人本体的一致。
行业的常见困境是,采集设备与机器人结构不同,数据要经过复杂的运动重定向和视觉迁移才能使用,关键信息容易在转换中丢失。
TwinDEX的做法是在硬件层面取消这道转换:在运动学上保持自由度、关节轴和连杆比例一致;在接触力学上保持接触材料、几何和表面特性一致,并配置对应触觉传感器;在视觉上保持外观一致。
![]()
第二个层面,是数据本身的一致性,自变量针对关节、手腕定位、抖动和漂移等关键精度指标进行优化,降低关节、手腕定位以及长时间采集中的抖动和漂移。
第三个层面,是训练与执行的一致性。
针对无本体采集容易受到场地变化、坐标系和标定误差影响的问题,自变量也对训练和控制方式进行了相应设计。比如双手协作时,模型重点学习的是两只手之间的距离、方向和姿态,而不是它们在空间中的绝对位置。这样换一张桌子、换一个操作者,双手之间的协作关系仍然成立。模型对场地变化适应能力更强。
可拓展性解决的是规模问题,无本体加可穿戴,让数据生产摆脱机器人本体。
具身模型的训练分预训练和后训练两段,后训练一般依赖真机数据微调,而真机数据离不开本体和场地,规模越大越是瓶颈。
TwinDEX让数据采集可以不再需要机器人本体:一套可穿戴外骨骼,一个人、一张桌子,就是一个数据采集单元,能带进办公室、厨房、工位,多人多地点并行开工。
穿戴式还保留了人类最自然的控制闭环:看得到物体、感受得到接触,可以即时调整动作,接触密集任务的数据质量因此更高。
这一通设计最终落到了两个结果上:无本体数据的训练效果,以及它的生产效率。
自变量此前的数采方案里,无本体数据与真机数据按10:1混合即可媲美全真机训练。
而这一次,多任务测试进一步显示,随着数据量增加,纯无本体数据训练出的策略与真机数据训练的策略表现几乎同步提升,并最终达到相近水平,意味着无本体数据在训练效果上几乎可以 100% 替代真机遥操作数据。
![]()
在数据生产端,TwinDEX的优势更加明显:一套可穿戴设备就能替代机器人本体成为采集单元,相关任务的数据采集效率达到真机遥操作的5.3 倍。
![]()
数据价值接近真机,生产又摆脱真机,这才是TwinDEX真正想解决的问题:让高质量的机器人数据,既能采得出来,也能规模化生产。
03
具身智能的「数据金字塔」,
正在发生倾斜
机器人数据的矛盾正在发生变化。
具身智能的数据结构常被描述成金字塔:底层是互联网视频与仿真,中层是Ego、UMI 等主动采集式无本体数据,顶层是真机数据。
眼下趋势是大量使用无本体数据,少量真机只做锚定,比例甚至到90%比10%。原因不难理解:本体昂贵,遥操作把机器人、场地、操作员绑在一起,规模一扩大就成了瓶颈;模型对大规模、多样化真实数据的需求还在增长,robot-free由此成了热词。
目前比较典型的无本体数据路线,大致可以分成两类。
第一类是人类视频或第一视角视频。优势是便宜、容易规模化,却缺少精确的手指运动、接触和力信息。
第二类是手套、外骨骼等可穿戴设备以及 UMI。但采集端与机器人之间仍然存在运动学、接触力学、视觉和时序上的差异。
现有方案普遍面对四个gap:运动学结构不同的kinematic gap;接触力学信息缺失的contact gap,最容易被忽视也最致命,「看起来正确」的动作迁移过去仍会失败;采集画面与部署画面不一致的visual gap;多模态信号彼此错位的temporal gap。
行业已经在针对这些问题寻找办法,在硬件、视频渲染、仿真方面都做了尝试。
▪ 有的方案通过更高精度的传感器、SLAM和同步技术提升采集质量,实现部分任务零真机后训练,但复杂遮挡与快速运动场景仍会重建失败;
▪ 有的方案通过视频编辑、分割和渲染,让人类视频里的手变成机器人手,但复杂接触场景效果打折;
▪ 还有方案借助仿真补足真实数据里缺失的接触信息,可力学信息仍然不够准确,更多靠仿真去猜;
▪ 也有研究尝试依靠更大规模的模型和预训练数据,让模型自行学习跨本体对应关系,但涌现依赖大模型,仍需真机兜底。
这些方案虽然路径不同,但都在解决同一个问题:如何在低成本和高质量之间找到平衡。
这也是灵巧操作长期存在的「不可能三角」——数据质量、操作灵巧性和规模化生产很难同时兼得。
而且,这四类解法的共同特征,是都发生在数据采集之后:硬件测得更准、算法事后修正、仿真补缺口、模型涌现对齐,都是一种「事后补偿」策略。
这类研究其实已经说明,行业真正需要解决的问题,已经超出了「怎样脱离机器人采数据」:采集端和执行端之间如何建立稳定对应关系,或许更为关键。
04
当数据足够「便宜管饱」,
更高层级的智能将成为可能
自变量先意识到了这一点,TwinDEX选择的切入点十分独特,它从机器人最终的执行效果倒推数据采集端的设计。采集设备与执行设备在结构、接触、视觉上同构,gap从设计阶段就被消除。TwinDEX在全球范围内首次实现了数据质量、操作灵巧性和规模化生产这三者的结合。
这两条路线的分野值得多说一句。行业在琢磨如何用算法、仿真、规模把差距填平;自变量的选择是,从硬件设计的第一天起,就不让这个差距产生。实际上,自变量其实是改变了数据生产的组织方式。
这种领先也体现在系统问题的定义方式上。多数方案先考虑怎么采数据,再想办法把数据映射给机器人。但如果采集设备、机器人执行器、数据处理和策略训练分别优化,最后再通过算法把它们拼起来,那么每个环节之间都可能产生新的误差。
TwinDEX从机器人最终要执行的效果倒推采集端应该长成什么样,把硬件、数据和模型作为一个系统整体设计,而不是把各个环节单独做到最优再拼接起来。
这样做的直接结果,是在保证灵巧操作和数据质量的同时,也打开了规模化采集的空间。
这套思路还带来一个值得关注的延伸:数据层和模型层可以进一步解耦。
这套系统可以使用自变量自家的 WALL-OSS 开源模型,也可以适配 π0.5 等不同基础模型。
传统情况下,换模型又可能要重新处理数据接口和训练流程。而TwinDEX采集端和执行端之间的 embodiment 对齐已经在系统底层完成。
即使模型层发生变化,数据和机器人之间的对应关系依然可以保留。
换句话说,模型面对的是一套稳定的数据和动作接口,而不需要每换一个模型,就重新解决一次人手与机器人之间的差异。
对开发者来说,不需要被某一个模型绑定,可以自由选用最适合当前任务的模型,或者随着模型生态的演进随时升级替换,数据管线不需要跟着重做一套。
对落地来说,当下一代模型出现时,已经采集好的数万条数据资产不会作废,可以直接用来训练新模型。数据采集和模型选型可以各自独立迭代,互不拖累。
如果这个方向最终成立,具身数据的价值就可能发生变化。
按照自变量的规划,下一阶段的数据采集会进一步走向开放环境和长尾任务,为机器人模型提供更加丰富、多样的真实世界操作数据。
当这套体系能够持续运转,数据规模本身就可能成为机器人能力增长的重要变量:数据越丰富,模型覆盖的任务和环境越广;能力提升后,又能够处理更多过去没有覆盖的场景,进一步形成新的数据积累。
从这个角度看,TwinDEX真正值得关注的地方,其实不仅仅在于让机器人少用一些真机数据,更在于它让具身智能有机会建立一套可以持续扩张的数据生产体系。
当灵巧操作的数据积累跨过某个临界点,机器人获得足够丰富、多样的真实世界操作经验,更高层次的智能涌现或许也会真正变得触手可及。这才是自变量做这套系统的终极目的。
上车,带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲PPT
大会报告全文
热门论文解读
学术新星访谈
未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!
公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.