当前人形机器人行业硬件方案趋于收敛,“大脑”训练成为决胜关键,而数据量级和质量直接决定模型泛化能力。一个残酷的现实是:机器人可用的真实物理交互数据总量仅约50万小时,不足大语言模型训练数据的万分之一。
![]()
据2026年机器人全产业链接会披露,GPT-2和GPT-3的训练数据分别对应约79万小时和1100万小时,而要实现可用的具身智能,至少需要1000万小时的多模态数据。由于当前采集良率仅20%-40%,且多场景、长尾数据等因素叠加,实际需求远超这一数字——觅蜂已把2030年目标数据采集量定在100亿小时。
2025年数据采集需求占人形机器人整体订单约31%,2026年这一比例预计将突破50%。京东提出两年内采集1000万小时真实场景视频数据,并发动最多60万人参与采集行动。数据正从研发辅助需求,升级为行业核心生产力。
目前真实数据采集主要有三类路线:真机遥操作、无本体采集和仿真合成。
真机遥操作精度最高,操作员通过VR头显同步控制机器人完成动作,产出的数据可直接用于训练VLA模型。但其成本高昂——特斯拉Optimus数据采集员时薪在25至48美元,且长时间操作容易引发眩晕,废片率较高。
无本体采集(如UMI和EGO)成本更低。EGO(第一人称视角)采用轻量化头戴设备采集人类操作视频,据斯坦福研究验证,仅2万小时异构数据即可让机器人初步涌现自动化能力——给模型喂2万小时数据后,再给一段40秒的洗碗视频,它就能初步学会洗碗。觅蜂科技将EGO采集成本降至传统真机摇操的三分之一甚至更低。
仿真合成数据成本最低、生成最快,但与真实物理世界存在偏差,难以完全替代真机数据,目前多作为补充方案。
数据采集爆发正带动四个核心环节扩容:
数采设备供应链是当前确定性最强的受益方向。无论采用哪种采集路线,相机(尤其是3D深度相机)、IMU惯性测量单元、触觉传感器都是刚需。奥比中光在3D深度相机领域领跑,订单供不应求;华依科技已与觅蜂科技达成IMU批量供货合作。
第三方数采服务商凭借数据标注和场景管理经验获得头部订单。京东、智源等企业自建数采工厂,同时与外部数据公司协同。
仿真平台方面,英伟达、索辰科技是国内外代表玩家。
垂类应用中,细分场景的专属数据库具备稀缺性,有望率先实现商业化落地。
国金证券研报指出,数采爆发有望拉动相机、IMU、触觉传感器等高ASP环节规模快速提升,竞争格局清晰、增长空间最大。当前全球数据缺口依然巨大,头部玩家已经开始布局千万小时甚至百亿小时级别的采集目标,数据设备、服务和传感器供应链都将迎来持续增长。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.