![]()
好像从去年下半年开始,越来越多人形机器人公司都在讲同一个故事:我们的机器人能进工厂了。
这类新闻也越来越多。
在美国南卡罗来纳州的宝马工厂,Figure 02机器人在车身车间跑了将近11个月。累计运行1250多个小时,搬运了9万多个金属零件,直接参与了3万多辆宝马X3的生产,人工干预率接近零。
![]()
今年5月,Optimus Gen-3进入特斯拉的上海超级工厂总装车间,干座椅安装、内饰装配、零部件搬运和质量检测的活。马斯克说Optimus 3的研发已经到最后阶段,2027年有望大规模量产。
国内的步子迈得更大。早在2024年,一汽红旗就发布了国内汽车行业首个公开招标的人形机器人POC项目,紧随其后的是北汽、比亚迪、蔚来等大厂也纷纷引入具身智能进工厂。
今天就和大家聊聊,人形机器人“从被生产出来,到工厂干活”的这个阶段。
1
理想很丰满,现实很骨感
大家是不是以为,机器人买回来放进工厂就能干活了。远没那么简单。给大家科普一下,现在是怎么做的。
过去大半年,行业里形成了一个默认的路径。拿一个通用VLA基础模型,针对具体技能或任务做二次训练,然后部署上线。听起来顺理成章,但真正跑起来,每一步都在烧钱。
一个新技能,通常要收集数百上千条示范数据,训练调试几个月,才能把成功率拉到80%以上。这还只是针对某一个特定工位、特定物料、特定流程。换个场景,大部分工作得重来。不是因为机器人的脑子笨,它跑的是通用VLA模型,训练时见过世界上很多机器人本体,也见过很多场景,知识面很宽。
但问题恰恰出在宽,宽而不精。它不知道你这台机器人的胳膊有多长、关节有多灵活、控制延迟有多少。它也不知道工厂里的物料长什么样、工位怎么布局、节拍有多紧。
这些东西,每一个新任务都得重新学一遍,学身体、学基本操作、学这个任务。结果说得过去,但过程着实不太好看。
2
给机器人开一门"专业课"
针对这个行业痛点,乐聚给出了一个答案:在通用基模与具体技能、任务之间,加一层工业垂直领域模型。
针对自家的KUAVO夸父机器人,乐聚训练了一个叫「KUAVO-VLA」的工业垂域模型。
乐聚是这么做的。先用KUAVO机器人,攒了600多个小时的真机数据,覆盖了100项工业任务。
然后拿这些数据,在蚂蚁灵波的通用基模Lingbot-VLA上(通过Benchmark对比,在参测模型中综合表现最优),做二次训练,最终练出KUAVO-VLA。
有一个点,需要单独提一下:600小时数据,全部来自KUAVO这一款机器人本体。
这在行业里并不常见。很多模型训练用的是跨本体混合数据,不同机器人的动作空间、运动特性、控制规律混在一起,模型学起来会互相干扰。
就像你同时学钢琴和手风琴,手指的肌肉记忆会打架。乐聚这么做,就是要让模型集中精力学一套东西。
100项工业任务也不是随便选的。分拣、搬运、上下料、装配,这些是工厂里最常见的操作。不同任务里,识别、定位、抓取、搬运、放置这些基础环节反复出现。
模型学的是可复用的工业操作能力。
![]()
这么讲有点抽象,举个例子大家就懂了。你可以把人形机器人的能力成长,想象成一个人的求学之路。
第一层是通识教育,对应通用基础模型。
知识面广但不深。通用基模也是这样,优点是跨本体、跨场景,什么机器人的数据都吃,什么任务都了解一点,能力边界很宽,但落到具体场景就不够用了。
这一层的成功率大概20%左右。目前大脑大都是在做这一层的事,给机器人提供一个广泛的知识和能力起点。
第二层是专业课程,对应垂域模型。
就像上了大学,开始追求在一个专业领域里往深了钻。
KUAVO-VLA干的就是这件事,它让机器人在工业这个专业领域里干得更好。
这一层的成功率能拉到50%左右,已经具备了专业领域的基础能力。
第三层是实习就业培训,对应技能训练。
毕业进了工厂,师傅带你上手,教你这家厂的具体设备、具体工艺、具体标准。
二开厂商做的就是这个,给机器人做岗前技能培训,针对具体的物料、工位、流程做后训练和部署。
这一层的成功率能达到90%,甚至接近100%,真正能上岗干活。
最后是场景需求方,也就是工厂。
工厂根据自己的需求,调度和安排机器人上岗,就像招工人一样。
看完这个类比,你应该能理解,从前是高中毕业直接进厂打工,现在加了“专业课学习”,让实习和工作更轻松。
3
效果如何,用成绩单说话
乐聚做了一个Benchmark,25项任务,其中20项是定制化工业任务,5项来自公共任务集GM100。目的是让模型同时面对熟悉的工业操作和有公共参照意义的新场景。
对照模型选了三个行业里有代表性的通用基模:π 0.5、GR00T N1.7、Lingbot-VLA 2.0。
结果是,KUAVO-VLA的整体任务成功率和过程分都排第一。
![]()
相较于Lingbot-VLA 2.0。KUAVO-VLA的成功率提升了32%,过程分也提升了32.45%。
![]()
解释一下什么是过程分。
在工业场景里,过程与结果同样重要。动作抖不抖、决策稳不稳、中间有没有反复修正、每一步是不是一致,这些直接影响产线能不能用。
就算机器人能完成任务,但每次动作都磕磕绊绊,工厂也是不敢上线的。
KUAVO-VLA的成功率和过程分同步提升,说明垂域训练带来的是整个执行链路的稳定性。
此外, KUAVO-VLA也展现出了一定的零样本泛化能力。
由于本体适配和工业基础能力已经训练好了,新的任务只需要少量甚至零样本数据就能搞定。
举两个例子。
一个是流水线开关分拣。KUAVO-VLA只用了5小时的示范数据,成功率就达到了80%。
另一个是零食分拣。用了150条示范数据,成功率73.33%。
![]()
![]()
我们顺便看看其他任务的表现:
![]()
![]()
![]()
![]()
![]()
![]()
⬅️ 左划查看全部图片
4
从两层到三层,有哪些实实在在的好处
从“基础模型->技能”的两层结构,到“基础模型->垂域模型->技能”的三层结构,带来的变化是系统性的。
对开发者来说,训练新技能不再从零开始。
只需要针对具体的物料、工位、流程做适配,数据采集和训练的工作量大大减少。
对工厂来说,落地成本大大降低。
落地周期从数月缩短到一周左右,数据需求从成百上千降到一百多条,成本下降三分之二以上,而且新任务的执行稳定性会更有保障。
对整个行业来说,这意味着研发分工开始清晰了。
基模公司负责构建跨本体、跨场景的通用能力,做通识教育。
机器人平台公司负责适配自有本体,针对特定领域沉淀共性能力,开专业课。
技能训练公司面向具体场景做后训练和部署,相当于岗前培训。
场景方根据需求调度机器人上岗,就像工厂招工人一样。
5
人形机器人的分科时代,才刚刚开始
这个趋势其实在其他行业早就发生过。
PC时代,微软做操作系统,英特尔做芯片,戴尔惠普做整机,Adobe做应用软件。各司其职,整个生态才跑起来。
人形机器人现在也走到了类似的路口。
过去大家都想做全栈,从基模到本体到应用一条龙。但越往后走,越发现一个公司不可能把所有事情都做好。
基模需要海量数据和算力,本体需要机械电子和供应链,场景落地需要行业know-how和现场调试。
分工带来的不只是效率,还有节奏。
PC生态成型之后,行业进步就不再依赖某家公司的灵光一闪,而是每一层各自往前挪一点,整体就往前走一大步。
我相信人形机器人的发展,也会加速向前。
如果你有任何看法,欢迎在评论区一起讨论
如果有一点收获,可以点赞、转发、推荐文章,关注「AI机器人茶馆」
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.