文 | 公爵互联社,作者 |牛金鹏
这个夏天,人形机器人行业的新闻是一条比一条炸。
天骄队在机器人运动会上百米跑了8秒64,比博尔特的世界纪录还快将近一秒;天卓队1500米2分21秒64,人类3分26秒的纪录被直接甩在身后。智元机器人第1.5万台通用具身机器人6月正式下线,距离第1万台下线还不到三个月。小鹏机器人首轮融资超9亿美元,投后估值63亿美元。软银更狠,被曝出拟60亿美元收购1X Technologies多数股权。
身体越来越强,价格越来越低,产量却越拉越大。但你要是跟做机器人算法的工程师聊一聊,他们多半会叹口气:硬件现在真不缺了,缺的是数据。
这话听着反直觉——都万台量产了,还缺数据?缺。而且缺得厉害。
大语言模型能从GPT‑1迭代到GPT‑5.6,靠的是互联网上免费的文本数据,网页、书籍、论文、代码,爬下来就能用。但机器人要的不是文字,是物理世界的真实交互——伸手抓一个杯子该用多大力,踩到一滩水的重心怎么调,一个没见过的工具怎么上手。这些数据,互联网上一条都没有。
每一条都得让机器人在真实世界里亲手做一遍。贵,慢,还容易坏。
行业现在集体撞上一堵墙:身体已经进量产时代了,大脑还在等米下锅。
大模型喝自来水,机器人喝瓶装水
机器人的数据饥荒,不是“数据不够多”那么简单,是它从根上就和大模型不是一回事。
训练大语言模型,数据从哪来?全网爬。Common Crawl一个公开数据集就有超过2500亿个token的网页文本,维基百科、GitHub、百万册图书,全部免费下载。大厂之间拼的不是数据有没有,是谁清洗得更干净、优质数据比例更高。数据是自来水,拧开龙头就有。
机器人完全是另一套逻辑。
你想让它学会抓杯子,给它看一万张杯子的照片没用。照片只告诉它杯子长什么样,不告诉它抓的时候手指怎么弯、用多大劲、杯子滑了怎么补。这些信息,只有让机械手真的伸出去、碰到杯子、感受到阻力、完成抓取,才能产生一条有效数据。
一条数据,等于一次真实的物理操作。
操作一次多久?简单抓取从感知到执行大概几秒钟。但要覆盖不同形状、不同材质、不同位置、不同光照下的抓取,学术界的估计是百万级到千万级的真实交互。
一千万次抓取是什么概念?一台机器人24小时不停,一次10秒,一天8640次,抓满一千万次要将近1200天,三年多。这还只是抓杯子一个动作。
而且机器人不是手机,它会坏。关节电机有寿命,减速器会磨损,机械臂高频操作容易出故障。一台机器高强度跑数据,几个月可能就得修一次,修的时候就是零产出。
大模型的数据是数字拷贝,边际成本几乎为零;机器人的数据是物理消耗,每一条都要花钱花时间。一个自来水,一个瓶装水还得自己灌装——这就是为什么大模型两年迭代三代,机器人的通用操作能力十年了还在实验室打转。
有个对比很说明问题。2023年10月,谷歌DeepMind联合全球21家机构、34个学术实验室,攒出了目前全球最大的开源真实机器人数据集Open X‑Embodiment,总共100多万条轨迹,覆盖22种机器人、500多种技能。听着很多对吧?但分散到500多种技能上,平均每种技能不到2000条轨迹。而大模型那边,光是一个Common Crawl就是2500亿级别的token。两个量级差了不止一百万倍。
WRC 2026同期举办的具身智能专题论坛上,好几位技术负责人在公开讨论里说了类似的话:现在算力不缺,算法框架也不缺,缺的是足够多、足够好、足够多样的真实物理交互数据。
仿真救不了场
真机采集又贵又慢,那用模拟器行不行?在电脑里建个虚拟世界,机器人在里面练,练好了搬到真实世界——行业管这个叫sim2real。
想法挺好,现实却很骨感。
模拟器里的世界是程序员写出来的。一个杯子多重、摩擦力多少、表面粗糙度,全靠人工设。你设200克,真实杯子可能180克也可能250克;你设摩擦系数0.4,杯子沾了油可能就变成0.2。差一点,结果就差了很多。
最难的是接触。机械手碰到物体那一瞬间,形变、摩擦、滑动、反作用力,这些在模拟器里很难算准。学术界有个词叫“接触丰富操作”,意思就是只要涉及接触,仿真就容易翻车。
结果就是:模拟器里练一千万次,成功率99%,搬到真机上一上手,成功率可能直接掉到30%。模拟器里的杯子和真实的杯子,根本不是同一个东西。
其实行业里不是没有努力。英伟达的Isaac Sim、微软的Mujoco、谷歌的DeepMind Control Suite,都是顶级仿真的平台。各家也在做“域随机化”——模拟器里把物体颜色、形状、重量、摩擦系数随机变,让机器人见过各种杯子,指望到真实世界能泛化。
但域随机化解决的是“见过很多种”,解决不了“真实世界有一种你没见过的”。真实世界的多样性是无限的,模拟器再怎么随机也是有限的。这个鸿沟,目前没有哪家公司能填上。
WRC上有个细节很说明问题。不少展台的机器人演示分拣、叠衣服、操作工具,看着行云流水。但你凑近了看,物品位置是固定的,光照是调好的,连物品本身都是挑过的标准件。你把东西挪个位置、换个牌子,或者让观众随便放一个上去,成功率就有可能立刻断崖式的掉。
不是工程师不想做随机测试,是随机测试一上就翻车。翻来翻去,原因还是数据不够——没在足够多变化的真实场景里练过,遇到没见过的就懵。
仿真能用来预训练、能验证算法,但替代不了真实数据。就像你在驾校模拟器里开了一万小时,真上路该紧张还是紧张,模拟器里没有真实的马路杀手。
一个死循环
数据饥荒最让人头疼的地方,不是难,是它绕成了一个圈。
想让机器人变聪明,需要大量真实场景的数据。想拿到真实场景的数据,得让机器人先进到真实场景里跑。想让它进真实场景,它得先足够聪明、能稳定干活、不闯祸。但它不够聪明,是因为还没有足够的数据。
要数据,要场景,要智能,要数据。转一圈回来了。
大模型从来没有遇到过这个问题。它爬数据的时候不需要先证明自己能写文章,互联网数据是开放的、免费的、谁都能拿。
机器人却不行。工厂不会让一台还不稳定的机器人上产线的,万一撞坏设备、伤了人、耽误生产,谁担这个责任?家庭更不会买一台经常犯错的机器人,打碎个陶瓷有可能比机器本身还贵重。
真实场景是有门槛的。你不够好就进不去,进不去就拿不到数据,拿不到数据就永远不够好。
所以现在大部分公司的数据还停留在实验室采集中,自己实验室搭几个标准场景,机器人反复操作攒数据。但实验室场景是有限的、标准化的,跟真实世界的多样性比就是九牛一毛。
也有人试过遥控操作:人戴VR设备远程操控机器人,人怎么做机器跟着做,同时记录数据。这样采集速度比机器人自主学习快,质量也高,毕竟是人类专家在操作。
但遥控操作也有一个问题。贵,熟练操作员时薪不低还得培训;慢,一个人一次只能操控一台;数据多样性还是受限,操作员的动作就那么多,真实场景的变化是无限的。更关键的是,遥控操作采的是“人怎么操作”,不是“机器人怎么自主操作”。机器人最终得学会自己决策自己执行,不能永远跟着人类学。遥控操作能做冷启动,解决不了规模化。
至少在公开信息里,还没有哪一家公司宣布跑通了“低成本、规模化、高质量获取真实物理数据”的闭环。大家都在圈里打转,谁先跳出来,谁就拿到下一个时代的入场券。
几条路,都还没跑通
死循环摆在这,行业不可能干等着。目前能看到几条思路,但每一条都还早。
最直接的是重资产堆量——要么把机器人铺到真实场景里边干活边攒,要么自己建个“数据工厂”,几百台机器24小时专门采集数据。前者受限于场景门槛,客户不让不稳定的机器进场,通常只能先从仓储分拣这种半标准化场景切入;后者成本极高,而且“人造的真实”和“真实的真实”永远有差距,你在工厂里练了一万种抓杯子,客户厂里那个杯子可能还是第一万零一种。一万台机器人听起来很多,分散到无数场景和任务里,每个场景分到的还是不够。
另一条路是跨机构共享数据,谷歌的Open X‑Embodiment就是这个思路——三十多个学术实验室把各自的数据凑在一起,100多万条轨迹开源给全行业用。但问题也很明显:贡献者主要是高校和研究所,商业公司很少愿意把核心数据拿出来共享;而且22种机器人硬件不同、传感器不同、接口不同,数据格式不统一,用起来要做大量的适配。开源数据集能降低入门门槛,但解决不了商业公司的核心数据需求。
还有人想用大模型生成合成数据,真实数据不够,让大模型根据文字描述生成一段机器人操作的视频轨迹拿来训练。听着有想象力,但目前还很早期。大模型生成的虚拟操作和真实物理操作之间同样有鸿沟,而且大模型本身就没怎么见过真实物理交互,它脑补出来的东西可能从根上就不对。
几条路,没有一条被验证跑通。所有人都知道数据是瓶颈,但没有人找到低成本规模化解决的办法。
身体在军备竞赛,大脑在闹饥荒
回到开头那个热闹的今天。
百米8秒64、1.5万台下线、9亿美元融资、60亿美元收购,这些新闻读着让人觉得人形机器人马上就要爆发了。但你把视线从身体移到大脑,会发现另一个更安静也更严峻的现实:运动能力一年一个台阶,通用智能的进步速度远没有看起来那么快。
原因不在算法,在数据。
VLA模型、世界模型、强化学习,这些框架这两年进步确实大。但算法是菜谱,数据是食材,菜谱再精美没有食材也做不出菜。现在菜谱更新到第三版了,食材还在等米下锅。
这就造成一个很拧巴的局面:行业都在卷身体——关节数量、运动速度、负载能力、量产规模,因为这些看得见摸得着、好量化好宣传。数据这种看不见摸不着、短期出不了成绩的,反而投入不足。
但决定机器人能不能真正上班的,不是它跑多快,是它能不能在一个没见过的场景里自己想办法把活干了。这个能力,主要靠数据喂出来。
所以评估一家机器人公司,别只看本体参数和量产计划,该问的是:你们现在有多少小时真实交互的数据?采集成本和速度是多少?数据闭环跑通了吗?这三个问题的答案,比自由度和百米速度更能决定这家公司三年后值不值钱。
不是头部玩家就别卷身体了,供应链已经非常成熟,卷不过宇树,也卷不过那些有大厂背书、能砸钱铺量的玩家。找个垂直场景扎进去,把这个场景的数据吃干榨净,可能更聪明。通用数据大家都缺,但垂直场景的数据是可以靠深耕攒出来的。一个只做电力巡检的机器人,在电力场景的数据量可能比所有通用机器人公司加起来都多,这就是壁垒。
往大了说,数据饥荒不是某一家的事,是基础设施的问题。大模型时代有开源数据集、有数据标注的产业,机器人时代也需要一套物理数据基础设施——标准化的格式、共享平台、低成本采集方案。谁能把这套建起来,谁就不只是一家机器人公司,而是整个行业的水电煤供应商。
结束语
2026年,人形机器人的身体已经足够强壮了。
能跑赢博尔特,能跳过高台,能后空翻,能拧螺丝能端茶倒水。但你把它放到一个没见过的房间里,给它一个没见过的工具,让它做一件没练过的事——它大概率还是会愣住,或者犯错。
因为它的大脑,还没见过足够多的世界。
造身体的问题,供应链解决了。造大脑的问题,算法框架也基本清晰了。现在卡脖子的是最朴素也最难的一件事:让机器人在真实世界里,亲手做足够多的事,见足够多的场面。
这是成本问题、规模问题、商业逻辑问题,也是接下来三到五年行业最需要啃的硬骨头。
身体的军备竞赛大家都看得见,大脑的粮食危机才刚刚开始。
谁先解决数据问题,谁才真正拥有了机器人的大脑。在那之前,所有号称“通用”的人形机器人,都还只是身体强壮、但没怎么见过世面的孩子。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.