KUAVO-VLA 的产业启示录:垂域模型正在成为具身智能商业化的关键一公里
![]()
智科天地
一个尚未接到下一步动作指令的机器人,无法安静待在原地,胳膊仍在轻微抖动。这是只经过后训练的具身模型跑在真机上的寻常一幕。
谈到落地中的这个小细节时提到,当训练数据尚未完全收敛,机器人不知道自己该干什么,就连保持不动这件事都做不好。
抖动只是表象,深层次的原因是,企业拿到开源的通用基模时,直接用自己的数据做技能训练。当基模放到跨本体、多构型,甚至人类视频的异构数据上训练时,任何本体拟合都不理想,因为模型不一定见过目标本体的数据。
毕竟后训练阶段的数据,既要学任务特征,又要补本体构型和运动特性,还要消化各种工程trick,学习量被严重摊薄,导致落地效果参差不齐。
对于具身智能公司而言,跨过PoC阶段,进入到承上启下的联合验证与工程化打磨阶段时,工程化鸿沟极大地消耗了有限资源,让规模化落地遥遥无期。
为此,动手了。
8月26日,发布并开源人形机器人垂域模型KUAVO-VLA,同时全部开放了模型、数据、代码。
这套解法不难理解,就是在通用基模与技能训练之间加一个环节,先面向自家本体做一轮二次训练。
相关负责人打了个比方:把本体比作人,那么通用基模就是完成了 大学通识教育 的大学生,在上岗操作前,给具身模型补上大学的专业课。
为落地造一颗更拟合的大脑
当下行业聚焦于做一个能学会什么都知道的通用大脑。可是当进入到真实场景后,得出了相反的判断。比起一个什么都会、什么都干不精的机器人,工厂更愿意为一个能把一道工序干明白的解决方案买单。
KUAVO-VLA便是这一判断的产物之一。 经Benchmark对比,LingBot-VLA 2.0在参测模型中综合表现最优,因此被选为KUAVO-VLA的能力基座,为其提供更高的通用能力起点。
通过6B参数全 量二次训练,积累起600多小时真机数据, 训练数据聚焦工业落地场景,覆盖分拣、搬运、上下料、装配等100项典型工业任务。通过多样化物料、工位与任务组合,模型得以沉淀出可复用的工业垂域操作能力。
在25项测试任务中,KUAVO-VLA 1.0取得48.27%的整体任务成功率和74.51%的过程分,两项指标均位列第一。
对比骨干网络LingbotVLA2.0的测试基线,任务成功率为 16.27%,过程分为 42.06%。
测试中出现了一些让人意外的成果,比如 减震器下线任务在实验测试范围内 做到了100%成功率。评测者有意把物体放到偏门位置,模型依然处理得了。开篇提到的那个细节也能看出这款垂域具身智能模型的效果:本体在训练收敛后,无动作指令时,本体安稳地站在原地。
到这个时候,端到端才有被打通的可能。到了这一步,感知数据才能直接映射为动作,从而省去传统机械臂+机器视觉方案里,大量工程化解算的过程,让机器人从数据里学习人的行为。
说到底,KUAVO-VLA解决的是数据问题。人人都知道垂域二次训练管用,但不是所有厂商都能做的。要求具身模型厂商能源源不断地获取足量的、与本体严格同构的真机数据。与此同时,数据不仅要了解本体怎么动,还要了解工厂长什么样——为此深入一线调研了70多家真实工厂、1000多个场景。换句话说,要想把专业课办起来,提供课程的学校得持续供应来自真实场景的教材。
真实数据是生产能力
具身智能行业谈数据稀缺谈了很久,有没有数据不构成困难,难在持续生产数据。
敢这么干的基础是实现了数据生产工业化。
参与共建多个训练场 ,真实工厂里跑出来的场景被工业项目部拆解成一个个动作单元,然后复刻到训练场里,配合自动任务派发与自动数据清洗。这其实已经形成了一条处理真机数据的流水线。
进一步拆解这条流水线,很容易看到这套方案的&;地基&;是一条全栈自研的国产链路。包括全栈自研的本体、数据、大脑、小脑,甚至还延伸到了从采集设备到训练、推理算力的国产化链路。
由于全栈自研,数据从笨重的重资产,变成可供随用随取的生产资料。模型迭代受到两个变量影响,一个是采集周期,另一个是产线吞吐。如果数据变成随取随用,采集周期将不再制约模型的迭代速度,而只取决于产线的吞吐。掌握真机数据的生产能力,相当于坐拥持续迭代的燃料。
具身智能需要一场大分工
做垂域模型的动机,有相当一部分源于深入到产业一线后的摩擦。
工业落地速度加快之后,大量场景需求找上门,但一家公司不可能开发完世界上所有的场景,必须依靠二次开发伙伴。二次开发公司也有自己的痛点,比如有工业落地经验,却没有具身经验。从基模到技能训练的链路要重新走一遍,学一个完整任务,数月就过去了;每迭代一次,动辄半年。
这实际上是浪费资源的重复造轮子,KUAVO-VLA开源便想解决这一问题。
事实上,意识到,行业落地需要有一套分层分工体系。基模公司完成从小学到中学的通识教育;垂域模型让机器人聚焦具体本体与场景,修完大学专业课;然后到技能公司做岗前培训,实现三个月即可交付;最后由场景需求方让机器人快速上岗。
在这个过程中无人需要重复造轮子,当然,也没有一家公司能把所有板块都做成长板。
围绕这套分工,给自己设置了一个金字塔形的定位。
塔底是开放的生态底座。通过投资一体化关节、电机、灵巧手、具身大脑、操作系统等上下游企业,联合建设大规模产线与控制器公司,以及70余家产业链伙伴和上万名开发者,构成支撑整个体系运转的基础设施。
塔身是场景落地。科研、商服、工业、训练场四大场景,十余个商业化解决方案,完成从技术验证到商业交付的跨越。
塔尖是技术突破。数据-大脑-小脑-本体的全栈国产化体系,KUAVO-VLA是这一层的成果,但不是终点。
结语
过去三年时间,人形机器人行业的叙事重心经历了三次迁移。
本体能走能跑是行业最初的关注点,不久之后玩家们开始聚焦于更大的大脑参数,或是更惊艳Demo。到了今年,WAIC和WRC上已经看到了第三次迁移的苗头,厂商们更关注机器人到底在工位上创造多少价值。
持续的融资和密集的发布会已经决出了前两个阶段的赢家。第三阶段的胜负,只能由工厂的节拍与部署的成本决定,最好的指标就是客户的复购。
第三次迁移意味着行业的评价体系正在被改写。
过去缺乏准绳时,衡量具生智能厂商的标准大多是显性的,比如实验室里的成功率数字与演示视频里的惊艳一瞬。而接下来,标准变成了隐性的慢变量,诸如真机数据产能、模型与本体的拟合度、生态伙伴的分工效率等等。具身智能从告别单点突破后,将随之进入体系化竞争的深水区。
对国内厂商而言,是一个机遇窗口。
国内拥有全球最密集的制造业场景与最完整的机器人供应链。如果能将需求翻译成数据、把数据转化为技能、把技能分发到千行百业的产业管道,总之只要修好这条管道,行业水位将自然而然被抬高。
具身智能的赛道足够宽,一家无法全盘吃下,云厂商那套全栈打底、生态放大的打法仍是最有效的解法。
从这个角度来看,KUAVO-VLA的开源其实是向行业给出的一套分工协议。
协议的落脚点是把机器人快速送上工位,协议底部的签字栏位预留了很多,只不过先在其中一小片区域上,签上了自己的名字,剩下的留白, 是留给更多想加入具身行业的开发者和合作伙伴的。 当一个行业开始有人制定分工协议,而不是独自包揽所有环节时,规模化才真正开始。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.