人形机器人距离“真智能”还有多远?在杭州召开的第九届中国机器人峰会上,浙江大学教授、浙江人形机器人创新中心首席科学家熊蓉给出了自己的判断。
她表示,具身智能机器人的智能化能力,从低到高可以分为L1级至L5级,当前多数机器人仍处于L1级到L3级之间,距离在多个场景下完成多个非结构化任务的L5级仍需跨越数据层、表征层、感知层和模型层四道门槛。
![]()
熊蓉进行主题分享,图片来源:峰会官方
作为中国机器人赛场上最早一批拓荒者,熊蓉已经在机器人领域深耕了数十年,不仅做出了浙大第一代足球机器人,更带领几名浙大学生在2016年创办了迦智科技,并获得了红榕资本、字节跳动、联想创投等知名机构、企业的投资。经历10年发展,迦智科技成为了全球少数具备全栈式自主研发技术的通用智能移动机器人解决方案企业之一,并已向港交所主板递交上市申请。
今年3月,在国际机器人联合会发布的“2026年塑造机器人未来的11位女性”奖项中,熊蓉是唯一上榜的中国面孔。该奖项旨在表彰在技术研发、产业应用及人才培养方面作出卓越贡献的女性领军人物,被誉为“机器人领域的女性奥斯卡”。
“物理世界非常丰富、多样、复杂,我们没有办法对复杂世界用一套简单规则进行描述。”谈及当下具身智能机器人的智能化水平,熊蓉对财闻表示,机器人要真正实现大部分非结构化任务还需要努力。一方面,生活中的场景复杂多样,工厂的环境也复杂多样;另一方面,传统专家模型很难应对碎片化、多样化、动态变化的场景,“我们需要用具身智能解决多场景的柔性问题”。
碎片化场景呼唤具身智能
尽管当前具身智能人形机器人已经从实验室走向产业一线,但很少有一个场景需要大批量机器人,使得机器人部署呈现明显碎片化特点。
熊蓉在现场分享时指出,在碎片化情况下,每个岗位差异较大,接触的物品也各种各样,如果采用传统机器人可能需要多台协作才能完成。因此,能完成长程化作业工序的智能机器人成为新需求。
与此同时,任务执行柔性化要求也在不断提升。个性化、柔性化发展需要快速换线,汽车行业已采用混线方法。环境也更加非结构化,生活场景复杂多样,工厂环境同样如此。传统依靠专家编程部署,很难应对碎片化、多样化、动态变化的场景,必须用具身智能解决多场景柔性问题。
人形机器人并非具身智能唯一载体,但特别适合人类为自己创造的工作和生活环境,让其应用场景进一步丰富。
“一开始,我们都认为人形机器人很难在工业中应用,因为工业里有很多大负载的要求。”熊蓉在峰会现场分享道:“在近期和很多行业接触过程中,前一段很多工业机器人已经完成了大负载的工作,现在很多工作岗位是需要用视、力、触的感知能力,和行为的判断能力、双臂手的操作能力完成工作,所以人形机器人对这些岗位来讲也是适合的形态。”
值得注意的是,熊蓉指出,目前很多机器人能跑能跳,但缺乏智能性,属L1级;工业现场机器人能在特定场景完成特定功能,泛化性弱,属L2级;工厂AMR分拣机器人、送餐机器人接近L3级,实现特定场景一定泛化适应。但距离在多个场景具备完成多个非结构化任务,达到L5级还需要努力。
五大瓶颈仍待突破
熊蓉表示,近两年,具身智能技术在快速发展,2024年主要集中在如何用模仿学习、强化学习的方法,让机器人能跑、能跳,能打拳、能跳舞,以及结合语言视觉大模型提升它的交互能力。2025年,具身智能机器人基本上形成了这样的能力,目前很多产品都具备了这样的能力。
具身智能作业技术也在快速发展,从VLA到WAM,开展了多场景验证。不过,在真实场景落地过程中,仍面临泛化、精准、可靠、高效率、低成本五大瓶颈。
尤其是工业应用方面,比如精准性上要达到亚毫米级,“有的需0.05毫米,可靠性要4个9”;效率方面要接近人工。此外,成本还要考虑算力、调网、数据安全等,不能联网就对机器人端算力提出要求,变相增加了成本。
问题根源在于现有模型非常依赖数据。熊蓉表示,一旦数据没有覆盖,现实运行出现异常就会出错;场景变化、光照变化、物品变化就要重新采数据,并没有体现泛化能力。精准性上,虽然能做很多动作,但不能满足工业精准性要求,执行效率偏慢。反过来看,传统专家模型是具有一定通用性的,只不过不能解决长尾,而现在的具身智能模型往往是在某个专用场景下训练使用,尚未实现我们期待的泛化能力。“最大问题还是物理世界非常丰富、多样、复杂,我们没有办法对复杂世界用一套简单规则进行描述。”
数据层之外,表征层、模型层和感知层也是造成上述瓶颈的重要原因。在表征层,很多物理交互难以用视觉表征,比如拿一瓶水,有多重、表面光滑度决定接下来该用多少力,加上力触后又发现这些信息随物体质量、形状、材质产生变化,仿真和实物存在差距。
在感知方面,感知和行为对齐后如果感知能力无法提升,依然无法提升行为准确性,语言视觉大模型在开放混杂场景下感知准确度大大下滑。而在模型层,一味靠数据堆叠需要很长时间,落地场景数据缺乏,需要举一反三能力,实现零样本、少样本下的泛化。
视触力融合与双模型迭代破解难题
面对挑战,熊蓉介绍团队方法突破。一方面是打造真实到仿真、再到真实的数据链路,低成本获得大规模多样化数据。另一方面,打造视、力、触融合通用表征方法,使仿真里可大规模训练并应用到真实,解决力触难以仿真训练问题。此外,在感知增强方面,赋予语言视觉大模型空间理解能力,形成世界模型和具身模型协同进化方法。
她解释双模型迭代行为发育架构:世界模型里有增强认知模型,对现实感知重构并稀疏化表达、预测,推动具身模型发展。具身做大小脑分工,其中,大脑适应环境任务,做长序列,检测任务可达不可达,不可达时生成探索行为;小脑是智能化小脑,视、力、触融合,具有语义知识,能行为决策和适应。
据熊蓉介绍,目前其团队形成多层次多样化能力,包括灵巧手抓各种东西,不需传统调参,重的软的轻的硬的都自适应:任意形状纹理对准,高精度插拔达0.03毫米,一次视角生成控制行为。柔性布料分片、对准,堆叠分离成功率99%,对准精度1毫米,适应衬衫布、牛仔布;透明液体分液精度达1毫升;堆叠混杂分拣,团队方法达90%以上,适应光照变化;长程任务具备环境理解、探索生成、持续记忆推理发育。
基于视触力融合与双模型迭代,目前熊蓉及其团队形成了以具身智能大小脑为核心的产品体系,搭载人形机器人整机,为研发、应用、二次开发伙伴提供SDK、数据采集训练、管理平台等工具。已经过多行业多场景验证,部分实现了规模化推广。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.