21世纪经济报道记者陶力
具身智能赛道,正成为互联网巨头与产业资本竞逐的“必争之地”。
8月3日,蚂蚁集团旗下具身智能公司灵波科技被曝已启动首轮融资,拟募资15亿元,计划在今年年底完成第二轮融资。公开数据显示,2026年上半年,国内具身智能赛道融资总额约438亿元,其中以具身大脑为核心业务的“大脑派”公司吸纳了222.53亿元,占比高达50.8%。
资本涌动之下,一个行业共识逐渐清晰:决定机器人“大脑”智力的,归根结底是物理世界数据。然而,真正有用的高质量物理世界数据,仍然严重匮乏。
此前,京东集团副总裁、京东云基础云业务负责人龚义成在WAIC期间向包括21世纪经济报道在内的媒体透露,京东正全力推进大规模具身智能数据采集项目,计划到明年积累约1000万小时具身数据,涵盖第一视角(Ego)视频、多模态数据、手部力学感知等多种类型,覆盖家庭、物流、工业及汽车维修保养等真实场景。
“行业不一定是没有数据,而是缺乏真正意义上高价值、有用的高质量数据,这才是行业真正的痛点。”龚义成直言。
真实经验反哺
千万小时并非一个拍脑袋得出的数字。龚义成坦承,这个目标不是一个绝对准确的数字,但它基于京东技术团队对具身模型数据飞轮的框架性理解,也与全球头部公司的判断相互印证。
在提出1000万小时之前,行业对具身数据规模的认知一直在上修——最初认为100万小时或许足够,后来逐渐提升至1000万小时量级。
龚义成解释,当数据量从数万条遥操作数据跃升至千万小时级别,原有的单机多卡训练基础设施已无法支撑,京东因此从零开始搭建了千卡级以上的具身智能训练框架,并于今年初发布相关论文。
但这只是第一阶段的里程碑。“1000万小时远远无法覆盖整个物理世界所有类型的场景数据。”龚义成表示,未来数据规模还会进一步扩大,底层技术栈也将随之演进。
值得注意的是,京东会更侧重于物理世界中的真实场景数据,比如Ego,也就是第一视角视频数据,以及关于人类动作描述的、结合真实场景的数据。
“之所以京东选择做这一类数据,是因为它需要的数据规模非常大。短时间内做到1000万小时数据,从资金投入、人员规模、场景需求,到技术投入,都需要非常强的能力。从整个行业来看,同时具备这些条件的企业并不多。京东在线下供应链和真实业务场景方面有丰富积累,同时未来也会成为机器人非常重要的消费方。因此,我们希望把这一类投入重、周期长、行业痛点明显的数据先做起来。”龚义成进一步补充。
数据成核心战场
市场已用真金白银投票:机器人“大脑”的竞争,本质上是一场数据规模的较量。
当前行业数据获取路径大致分为三类。其一为仿真数据路线,通过物理引擎生成大规模合成数据,成本低、可规模化,但“虚实鸿沟”(sim-to-real gap)始终是难以完全跨越的技术瓶颈。其二为真实场景采集,以京东为代表,依托线下供应链和业务场景,在物流、工业等真实环境中获取第一视角视频、多模态感知数据等高质量数据。其三为众包与开放平台路线,数据规模易扩展但质量参差不齐。
巨头卡位战已然展开。蚂蚁集团旗下灵波科技启动首轮融资,拟募资15亿元,觅蜂科技也从智元体系独立出来,主营具身智能、物理AI数据业务,国内布局这一赛道的还包括鹿明机器人、灵初智能等初创公司,以及京东JoyEgoCam团队等。
“谁掌握了最大规模的高质量物理世界数据,谁就掌握了具身智能时代的入场券。”一位关注该赛道的投资人对21世纪经济报道记者表示。这也解释了科技巨头为何愿意在数据采集上重金投入,它们既是数据供给方,未来也将是机器人产品的重要消费方,数据飞轮的商业闭环逻辑清晰。
不过,竞争尚处于早期,格局远未定型。正如龚义成所言,1000万小时远远无法覆盖整个物理世界所有类型的场景数据,没有经过模型验证和场景闭环的数据,可能只是“想象中的数据”。
在这场以数据为燃料的竞赛中,还需要形成“采集—训练—落地—回流”的完整闭环。眼下,具身智能的泛化能力和准确率,还没有达到所有工业场景的要求,还需要等待数据积累和模型能力达标,才有全面应用的可能性。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.