![]()
这项由Simple AI研究团队完成的研究,以预印本形式发布于2026年7月28日,论文编号为arXiv:2607.25895,感兴趣的读者可通过该编号查询完整论文。
机器人正在走进我们的生活,但它们的"学习成本"一直是个大麻烦。要让一台机器人学会叠衣服、整理桌面、把遥控器插进收纳盒,通常需要让它反复观看人类操作员在真实机器人上一次次示范——这就像你非得盯着主厨在同一口锅里炒菜才能学会,换了另一口锅就不会用了。Simple AI的研究团队换了一个思路:如果我们能让人类直接用手来示范,把动作记录得足够精确,是不是就可以绕过这口"专属的锅",直接把技能装进机器人的大脑?这正是HiFi-UMI要回答的问题。
一、为什么机器人学习这么贵?
教机器人做事,本质上是在给它喂"示范视频加动作数据"的套餐。问题在于,这套餐的食材极其昂贵。传统做法是让熟练的操作员坐在真实机器人旁边,通过遥控设备一帧一帧地引导机器臂运动,把每一次动作的位置、角度、力度全都记录下来。你可以把这个过程想成:要教一个厨师学徒炒蛋,你得亲自拿着他的手腕,在真实的锅上比划,每次还要专门记录下手腕转动了几度、锅铲移动了多远。组建一个专门的双臂人形机器人团队,配上专用的遥控装置,光是租场地、买机器、雇操作员,每积累一小时的动作数据,代价都相当可观。此前,业界曾有团队花费巨大资源,动用一百台双臂人形机器人在四千平方米的专用场地里才攒出近三千小时的数据。
为了降低这个门槛,学界早已注意到一种更便宜的思路:让人直接用手持设备模拟机器人的抓手,在任何场景下做示范,不需要机器人在场。这类设备里最有代表性的就是"通用操作接口"(UMI),本质上是一个装了相机和传感器的手持夹具,人握着它做示范,设备自动记录轨迹。但这类设备有个根本缺陷——记录的动作数据精度不够高,就像你用铅笔在纸上描一条线,结果线条总是歪的。正因如此,这类数据只被当成"预热训练"的材料,真正让机器人能上手干活,还得补充一批在真实机器人上采集的遥控数据做"收尾"。
HiFi-UMI的核心追问就在这里:这个"收尾"步骤是必须的吗?还是说,只要我们把手持设备的记录精度做得足够高,就可以完全跳过真实机器人的遥控环节?
二、精度不够,是设计出了什么问题?
要理解HiFi-UMI的改进,得先知道老方案哪里出了问题。研究团队把问题拆成了四块,就像一道菜的四个关键环节。
第一个环节是轨迹精度。传统手持设备靠机器视觉来追踪自己的位置,这种技术叫做"视觉惯性里程计"。它的工作原理像是你蒙着眼睛在房间里走,靠数自己走了多少步来判断位置——走得越远,误差越大。在操作过程中,手的遮挡、物体的移动都会让这个视觉系统频繁出错,轨迹一偏,动作数据就废了。
第二个环节是双手协调的相对位置。很多操作需要左右手配合,比如展开一件衬衫时两只手要保持特定的相对距离。老方案是用两个独立的设备分别追踪左右手,再事后把两份数据拼在一起,就像拍了两段视频再强行剪辑,对齐误差不可避免。
第三个环节是传感器的时间对齐。相机在拍照,惯性传感器在记录加速度,夹具的开合角度也在被记录,这些数据如果不是精确到同一时刻,就像一首乐曲里各种乐器不在同一个节拍上演奏,最终合成出来的是噪音,不是音乐。老方案的时间对齐精度通常在毫秒级别,这对于快速操作来说已经是不可忽视的误差。
第四个环节是视野覆盖。老方案通常在每只手的夹具上装一个155度的鱼眼相机,只看一个方向,遇到遮挡或者需要观察接触细节的时候就抓瞎了。
三、HiFi-UMI的四把钥匙
针对这四个问题,研究团队设计了四个对应的解决方案,共同构成了HiFi-UMI这套"高保真"手持数据采集系统。
解决轨迹精度问题的方法颇具创意。研究团队把一个立体相机对安装在操作者的头部,用头部视角而非手腕视角来追踪整个场景。这个改变背后有一个简单的逻辑:人在操作时,头部几乎不怎么晃动,而手腕会大幅度运动,还会被操作物体遮挡。头戴相机看到的是稳定的全局场景,适合做精确的三维定位。与此同时,系统采用的是"离线立体惯性SLAM"算法——"离线"的意思是数据采集完毕后再进行完整的计算优化,可以同时利用前后帧的信息互相校正,比实时计算要精准得多。每只手上还安装了一个带有明显视觉标记的立方体标靶,头戴相机可以直接识别这两个标靶,从而在同一个参考系下同时获知左手和右手的位置,双手相对位置的问题也顺手解决了。整套系统的端到端位置误差只有3毫米,相当于不到两颗米粒并排的宽度,而且无需任何外部追踪基础设施,完全便携。
解决时间对齐问题用的是一个硬件触发器。所有相机、惯性传感器和夹具角度编码器都通过同一根GPIO引线接收统一的触发信号,误差控制在40微秒以内。微秒是百万分之一秒,40微秒对于人类手部操作来说几乎可以忽略不计,这意味着所有传感器的时间戳都精确地指向同一个物理瞬间。这就像乐队指挥用一根指挥棒精确地打出节拍,每件乐器都在同一瞬间奏响。
解决视野问题靠的是每只手安装两个方向不平行的广角鱼眼相机,上下两个视角共同覆盖约200度的水平和垂直范围。加上头部的立体相机,整套设备共有六个摄像头,能全方位看到操作细节,几乎不存在盲区。
在夹具的形态设计上,研究团队也做了改变。过去的手持夹具更像一把枪形的扳机,操作者用手指扣动扳机来模拟机械爪的开合,这种方式和真实抓握感差异很大。HiFi-UMI设计的是一款全掌手套式夹具,形状参考人手结构,两个"手指"分别对应拇指和四指,宽窄不对称:窄的指尖部分适合精细操作小物件,宽的近端部分适合把持重物。这让操作者能用更自然的力量分布来完成示范,操作质感更接近真实手感。
此外,设备还内置了实时质量监控功能。在采集过程中,系统会实时检测欠曝光、运动模糊、操作者手部离开视野等问题,并通过语音提示告知操作者及时纠正,而不是等到数据采集完毕才发现一批废数据。操作者还可以在采集过程中实时标注任务和子任务的边界,减少后期处理的工作量。
四、从原始数据到可用训练集的流水线
采集到高保真的原始数据只是第一步,研究团队还建立了一套六阶段的自动化数据处理流水线,把原始录制转化为机器人可以直接学习的训练数据。
第一阶段是采集与上传,前面已经描述。第二阶段是轨迹重建与自动清洗。系统用离线立体惯性SLAM算法重建头部运动轨迹,再通过识别标靶推算双手轨迹,对异常的SLAM结果自动重新计算,并标注出残余的轨迹异常。这个阶段的重建成功率超过98%,失败的部分会被自动剔除。
第三阶段是仿真复现验证。这是整个流水线里最关键的质量门。研究团队为目标机器人开发了一套全身运动控制算法,把每一条重建出的轨迹在仿真器里"播放"一遍,检查机械臂能否真正完成这些动作而不违反运动学或动力学约束。通过这一关的轨迹才算合格的训练素材。这个验证通过率同样超过98%。把两道门叠加起来,最终保留率约为96%,也就是说原始采集中约96%的录制都能成为有效的训练数据,这个比例在业界相当高。
第四阶段是AI辅助标注。一个多视角标注模型同时分析头戴相机和手部相机的画面,推断任务进度、物体交互和动作边界,自动生成任务级和子任务级的文字描述、时间段边界、操作对象等结构化元数据。每条标注还附带置信度分数,低置信度的样本优先送交人工审核。
第五阶段是人工核验。人工标注员不是从头看所有数据,而是重点核查被自动系统标记为低置信度或有异常的部分,确认文字描述与视觉内容一致,纠正或补充AI标注的错误。所有审核结果都附带溯源信息,记录标注来源、审核状态、拒绝原因和修改历史。
第六阶段是数据分析与导出。系统从任务类别、场景类型、物体类别、动作模式、轨迹质量等多个维度统计数据分布,生成可视化的分布报告,供研究者根据目标任务的需求来平衡数据配比,例如上调某种操作类型的比例,或对重复度高的样本降权。最终导出的每个数据集样本都包含同步的六视角视频、标定的双臂轨迹、夹具开合状态、语言标注、子任务边界和质量控制元数据。
五、数据集:从单次尝试到两千小时宝库
截至论文发布时,这套系统已经累计采集并处理了超过两万小时的操作数据,涵盖四百八十余个场景,超过四百三十二万个完整操作样本。研究团队从中精选并公开发布了名为HiFi-UMI-2K的两千小时子集,包含四十八万余个样本,跨越一百一十余个场景,采用知识共享CC BY 4.0协议,允许商业用途,但要求注明来源。考虑到设备录制了操作者的头戴第一视角视频,所有出现人脸的画面都在发布前经过了遮掩处理,确保不含面部信息。
这个数据集的任务类型相当丰富,从放置与插入(占比约27%)、擦拭与清洁(约17%)、取出与拾取(约16%)、移动与抓放(约8%)到开合与展开(约7%)等十余种操作类型都有覆盖,跨越了厨房、卧室、浴室、书桌等多种日常场景。
六、三种机器人大脑,同一套无机器人数据
研究团队选择了三个风格各异的机器人策略模型来验证他们的核心假设,这样做是为了排除"只对某种特定模型有效"的可能性。
第一个是StarVLA-QwenPI,基于千问视觉语言模型构建的"视觉-语言-动作"模型(VLA),特点是纯粹的当下反应型:看到现在的画面,直接输出下一步的动作,不预测未来。第二个是OpenPI-π0.5,另一款公开发布的VLA模型,同样属于当下反应型,但来自不同的研究机构,内部架构也不同。第三个是LingBot-VA,属于"世界-动作模型"(WAM)家族,它会先预测未来几帧的画面会长什么样,然后再从这个预测的未来中反推出现在应该执行什么动作——相当于一个会"先在脑子里过一遍"再行动的系统。
三种模型的共同之处是接受相同格式的训练数据:来自手腕相机的四路视角图像(每只手各两路)、语言指令、机器人当前状态,以及一段未来的动作序列。头戴立体相机只用于数据采集时的轨迹重建,不作为模型的输入——也就是说,部署时的机器人完全不需要头戴任何摄像设备。
动作的表示方式也经过精心设计:每个动作步骤都表达为相对于当前时刻的位姿增量,而不是累积的绝对位置,这样即使机器人的起始位置每次略有不同,策略也能保持稳定。每只手的动作包含三维平移、旋转(用一种数学上更连续的六维表示法来编码旋转方向)和夹具开合量,双臂合计二十个数值。
七、四项任务,九百六十次真实机器人测试
评测在两台配备七自由度力控机械臂的双臂平台上进行,这台机器人在部署时安装的夹具和四个腕部相机与HiFi-UMI采集设备完全相同,消除了视觉接口的差异,剩余的差距只在于机械臂的运动学结构。
研究团队选择了四项具有代表性的桌面操作任务。第一项是污渍擦拭:机器人从桌上拾起毛巾,擦净指定区域的污渍,再把毛巾放回桌上,考验持续接触控制和空间覆盖能力。第二项是衬衫折叠:机器人依次折叠衬衫的左右袖,再折叠下摆,完成指定的折叠形态,考验双臂协调控制可变形物体的能力。第三项是遥控器插入:机器人抓取遥控器,将其精确插入目标收纳盒,考验精细约束插入能力。第四项是食材分类:机器人根据语义类别,把指定蔬菜放到粉色盘子上,把指定水果放到蓝色盘子上,考验语义理解和条件操作能力。
每个任务-策略组合测试四十次,测试前随机调整物体位置。评判标准是严格的二元成功率:在规定时间内完成全部任务目标、最终状态稳定持续两秒以上、无安全干预,方计为成功。测试全程由两名职能分离的评测员负责,一名负责加载和启动策略,另一名独立摆放场景——这种分工是为了防止评测员对某种策略有倾向性。所有策略的测试顺序是随机排列的,消除时间偏差。
HiFi-UMI数据采集的场景与评测场景完全不同,涉及不同的背景、光照、桌面外观和空间布局。相比之下,遥控操作的示范数据就是在评测场景里采集的。这意味着,遥控策略在视觉上和测试场景是完全匹配的,而HiFi-UMI策略面临的是从未见过的视觉环境,先天处于不利地位。
八、零机器人后训练的成绩单
实验结果相当清晰地支持了研究团队的核心假设。在VLA模型的对比中,StarVLA-QwenPI在使用HiFi-UMI数据后训练时,四项任务的综合成功率为51.3%;使用遥控数据后训练时为53.8%,差距仅为2.5个百分点。OpenPI-π0.5的HiFi-UMI版本综合成功率为77.5%,甚至比遥控版本的74.4%还高出3.1个百分点。两种方向相反的微小差异,都在四十次测试的统计噪音范围内,很难说哪种数据来源更好。
具体到单任务层面,两种数据来源各有胜负,没有一方始终占优。遥控数据在衬衫折叠上略有优势,HiFi-UMI数据在遥控器插入和食材分类上略有优势。OpenPI-π0.5在HiFi-UMI数据下的遥控器插入任务达到85%成功率,是所有条件中最高的单项成绩,这是在策略完全没见过评测场景的情况下取得的。
在WAM模型LingBot-VA的测试中,同样的结论成立。HiFi-UMI版本的综合成功率为56.9%,遥控版本为57.5%,差距仅0.6个百分点,方向也是HiFi-UMI略低。在四项单任务中,两种数据来源各赢两局。质性观察还发现,HiFi-UMI版本的策略动作更连贯、幅度更大、停顿更少,像是更"自信"的操作风格;但在遥控器插入任务上,这种直接风格有时会因为接触状态不理想而需要多次尝试,反而影响了成功率。
研究团队还专门测试了随着HiFi-UMI后训练数据量变化时的性能曲线,以遥控器插入任务为例。从400个样本到800个样本,成功率从37.5%跳升到65%,增幅惊人;从800到1600成功率升至70%;从1600到3200升至85%;从3200到6400则几乎没有变化,维持在82.5%左右。这说明在当前这道任务上,3200个样本左右就达到了饱和点,更多数据没能带来进一步提升,但仅凭机器人无关的手持数据就已足够。
九、大规模预训练的额外红利
研究团队还在StarVLA-QwenPI上单独验证了大规模HiFi-UMI预训练的价值,使用了四千小时的多任务数据进行一轮完整训练。
在训练过程中,模型对保留测试集的动作预测误差稳定下降了61%。更有趣的是,误差随训练量的变化遵循一个幂律关系:误差正比于训练量的负0.268次方,拟合R?高达0.993。这条几乎完美的对数线意味着,只要继续投入更多的HiFi-UMI数据,模型就会以可预测的速度持续进步。
为了检验这种进步是否真的代表泛化能力而非死记硬背,研究团队专门构建了一套包含十项从未出现在预训练数据中的任务的测试集,涵盖折叠连衣裙、折叠短袖、折叠裤子、面粉倒入碗中、摆放餐具、折叠袜子、面粉倒入锅中、锅铲放入炒锅、勺子放入电饭锅、勺子放入碟子等操作。大规模预训练让这十项未见任务的平均动作误差降低了41%,每项任务都有所改善。
不过,改善的幅度因任务类型而有明显差异。与餐具和器皿相关的刚性物体操作改善最快,颗粒物倒入的任务居中,衣物折叠改善最慢。研究团队认为这正好反映了预训练数据的构成:抓取和放置刚性物体的操作在预训练数据中占比最大(超过三分之一的帧),而涉及纺织品折叠的内容不到1%。模型能把大量接触过的操作模式迁移到新物体上,但如果预训练中根本没有类似的操作模式,迁移就相当有限。这个发现有实际指导意义:决定迁移效果的是"有没有见过类似的操作方式",而不是"有没有见过同一个物体"。
预训练的好处也体现在后续的任务专项训练上。以遥控器插入任务为例,预训练版本的StarVLA-QwenPI从800个任务专项样本开始就超过了从零开始训练时使用3200个样本的成绩,相当于把数据需求降低到了四分之一。在四项基准任务的综合对比中,预训练版本比从零开始的版本综合成功率高出18.1个百分点,并且在四项任务上全面领先。这说明大规模HiFi-UMI预训练不仅提升了泛化能力,也实质性地降低了学习新任务所需的示范数量。
十、研究的边界与未来方向
研究团队对自己工作的局限性保持了坦诚的态度。
当前的评测范围只覆盖了四项双臂桌面任务和三种策略骨架,结论对其他任务类型、其他机器人形态是否成立尚待验证。预训练的扩展性验证目前只在StarVLA-QwenPI上完成,需要更多骨架来确认结论的普遍性。
每个任务-策略组合只有四十次测试,换算过来每增减一次成功就改变2.5个百分点,细粒度任务间的差异很难做出可靠的排序判断,因此研究团队明确表示,单任务的差异只能作为描述性信息,成立的结论主要是跨任务的聚合结论。
精度提升对结果的贡献没有被拆解。系统同时改进了轨迹精度、双手相对位置、时间同步和视野覆盖四个方面,但研究中没有通过控制变量的方式单独测试每一项因素的边际贡献。"高精度数据有效"这一点得到了验证,但"每种精度需要达到什么最低水平"还是个开放的问题。
样本量的不平等也是需要说明的背景。HiFi-UMI后训练使用了约3200个样本,遥控后训练只用了约300个样本。这主要反映了两种采集方式的实际效率差异:手持设备可以多名操作者同时在多个场地并行采集,而真实机器人遥控每次只能用一台机器人、一个操作员。因此,实验比较的是两条不同的数据生产流水线,而非等量样本下的效率比较。
归根结底,这项研究做了一件看起来简单但意义深远的事:它证明了让机器人学习手持设备记录的人类示范不需要任何真实机器人数据收尾,只要这些记录足够精确,机器人就能直接拿来用。这把"机器人学技能"这件事的成本和门槛大幅拉低了。遥控数据贵在它是在目标机器人上采集的,占据了视觉和动力学上的天然优势,而HiFi-UMI在没有任何主场优势的情况下取得了几乎相同的成绩——这说明高精度的手持数据本身就足够好,不差在数据质量上,差的只是过去的技术没把精度做到位。
两千小时的HiFi-UMI-2K数据集已经开放下载,研究社区可以从这个起点出发探索更多可能性,也可以通过arXiv编号2607.25895找到完整的技术细节。
Q&A
Q1:HiFi-UMI的3毫米轨迹精度是怎么做到的?
A:HiFi-UMI把追踪相机从手腕移到了操作者的头部,头部在操作时比手腕稳定得多,也不容易被物体遮挡。系统采用离线立体惯性SLAM算法,在数据采集完成后进行完整的前后帧联合优化,比实时计算更精准。两只手上各有一个带视觉标记的立方体标靶,头戴相机同时看到两个标靶,就能在同一参考系下直接获得双手的精确位置,不需要事后拼接两套独立数据。最终测试精度约为3毫米,相当于不到两粒大米并排的宽度。
Q2:HiFi-UMI后训练用了3200个样本,遥控只用300个,这样比公平吗?
A:这两个数字反映的是两种数据采集方式的实际效率,而不是人为设定的不公平条件。手持设备可以多人同时在多个场地并行采集,速度远快于遥控方式;遥控方式每次需要真实机器人、专业操作员和助手共同参与,还要处理安全检查和硬件恢复的开销。研究团队明确说明,这个比较衡量的是两种完整的数据生产流水线的实际表现,不是相同样本量下的效率对比。
Q3:大规模HiFi-UMI预训练为什么对衣物折叠的提升比餐具操作小那么多?
A:关键不在于模型有没有见过同一个物体,而在于有没有接触过类似的操作方式。预训练数据中抓取和放置刚性物体的操作占比超过三分之一,模型学到了丰富的刚性物体接触模式,很容易迁移到新餐具上。但涉及纺织品折叠的内容在预训练数据中不到1%,模型几乎没有学过如何处理可变形材料的展开和折叠,在面对衣物折叠任务时就只能"硬猜",提升自然有限。这也给后续数据采集提供了明确方向:增加更多衣物折叠的操作样本。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.