跨越数据“百万小时级”门槛
上海具身智能数据服务商成为全球首家,头部企业纷纷新增无本体采集业务
8月31日,上海具身智能数据服务商觅蜂科技正式交付第2万套无本体数采设备,累计产出的可交付无本体数据超过100万小时,成为全球首家实现无本体数采设备量产并率先跨越“百万小时级”数据门槛的服务商。
100万小时是训练具身智能模型的关键数据门槛。在这一规模上可以训练出“基本可用”的具身模型,而要达到GPT-3量级的能力,则需要约1000万小时数据,觅蜂预计这一目标今年底即可实现。
《上海市战略性新兴产业发展“十五五”规划》明确提出,要加快智能机器人本体产品、模型算法、数据采集等标准体系建设,推动实景、训练场数据采集和仿真数据合成,支撑本体与算法协同优化。
无本体采集的天生优势
所谓无本体采集,就是无需配置专门的数采机器人,转而在人的手部和头部佩戴专用设备;人只需正常工作,设备便会实时记录操作轨迹,最终反馈给机器人学习。
“无本体数据采集的天生优势在于,它不绑定任何一种类型的机器人。拿无本体数据‘喂’给机器人,能训练出通用、可泛化的具身模型。”觅蜂科技董事长姚卯青告诉记者,无本体数据几乎等同于人类手部关节的真实数据,能够直接把人的动作转化为机器人的关节动作,这也使其成为当前多数具身模型厂商的主流选择。
今年4月,觅蜂科技推出无本体采集设备MEgo,分为“头戴+裸手”“头戴+腕戴”“头戴+夹爪”三种形态,分别对应人类自然操作、腕部姿态与连续运动轨迹、机器人末端执行等不同数据需求。
目前,MEgo已实现规模量产,陆续进入家庭、办公、零售、生产、餐饮等真实场景。第2万套设备已交付国内某大型电商平台,将投入真实作业场景使用。腾讯Robotics X实验室也将与觅蜂开展无本体数据合作,为腾讯具身模型建设提供数据支持。
觅蜂并非唯一的入局者。今年以来,银河通用、星海图等国内头部具身智能企业纷纷新增无本体数据采集业务。日前,上海蚂蚁灵波与奥比中光联合推出无本体数采硬件平台,自变量、千寻智能等也相继发布无本体数采设备和方案,部分数采团队规模已超过1000人。
有望进入“众包”模式
除了第2万台数采设备下线,记者还注意到,在短短4个多月里,觅蜂已产出超过100万小时高质量无本体数据,成为全球首家跨越“百万小时级”无本体数据门槛的服务商。
为尽可能贴近真实场景,这100万小时数据覆盖22大类场景、1万多个真实环境、5万多类物体和500余种细分任务。其中,居住、办公、零售、生产、仓储、餐饮、文娱休闲、交通出行等八大高频场景贡献约82%的数据,构成面向通用物理AI能力的核心数据基础。公共服务、物流、医疗、教育等14类长尾场景,则覆盖了具身数据在垂直行业的应用。
如今,无本体数采设备已极大降低了采集门槛,社区工作者、全职宝妈、保洁员、快递员、外卖员戴上设备就能完成数据采集。记者了解到,智元食堂的保洁阿姨已率先成为“数采员”,8小时工作时间内可产出超过5小时的有效数据,效率是传统遥操作方式的数倍。
“我们希望发动大家把自己的独门绝技、绝活儿贡献出来,让机器人去看、去学,把时间和经验变成可以被量化结算的技能。”姚卯青表示,数采未来有望进入“众包”模式,有了多元、海量的数据,国产具身模型才能形成难以复制的“护城河”。
(来源:解放日报 记者 查睿)
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.