S1机器人看一遍就上手,传统需380次演示才追平,技术代差在哪?
![]()
科技棱镜
Skild AI刚发布的S1机器人基础模型,让整个具身智能圈炸了锅。
Skild AI发布S1机器人基础模型的官方推文截图
它的核心卖点只有一句话:看一遍人类演示,就能直接上手干从未见过的复杂任务,不用任何后训练。在官方测试里,这个“看一遍”的成功率达到了66%,而传统语言驱动的VLA路线在同类未知任务上只有9%。
如果想用传统路径追平这个66%的分数,需要先采集约380次相同任务的真机演示数据,做完完整后训练微调才行。
这不是一个简单的“谁更好”的问题。S1和传统真机微调路径的差异,本质上是两条完全不同的路线——一条追求“看过就会”,另一条走“练过才稳”。这两条路线的技术代差,咱们拆成四个维度来看。
预训练阶段,训练目标根本不在一个维度
传统VLA模型预训练的目的很明确:让模型先掌握一些基础能力,以后面对新任务时,需要的微调数据量可以少一点。但本质上,它仍然逃不过“每学一个新任务就得重新微调”的宿命。
S1的做法完全不同。它的预训练目标不是“减少后续微调数据量”,而是直接让模型学会从视频里理解任务意图、拆解步骤、组合已有技能——换句话说,把“从上下文学习”这件事,变成了模型的原生能力,而不是微调阶段的附加功能。
数据策略上也拉开了差距。传统VLA的数据来源相对单一,主要是真机交互数据。S1则采用了四源融合策略:真机遥操数据最贴近硬件但成本高,第一视角人类视频最容易规模化但和机器人本体差异大,UMI数据提供跨本体泛化能力,仿真数据便宜但存在sim-to-real鸿沟。
四种数据互相补位,把单一数据源的天生短板逐一破解。
这个环节是整个代差的基础底座。没有这一步的架构和数据策略重构,后面所有零微调能力根本无从谈起。
任务适配效率,成本直接降了两个数量级
这是最直观的差距。S1接到新任务时的流程是这样的:录一段人类演示视频,把这视频作为Prompt注入推理流程,11分钟后机器人就能自己上手干活。全程不碰任何模型权重,不跑任何微调步骤。
传统VLA要完成同样的任务,得先采集几十到几百小时真机数据,然后跑完一轮完整的后训练流程,周期以天甚至周计。Skild官方给出的对等数据是:传统路径需要约380次任务演示的后训练,才能追平S1只用1次演示达到的66%成功率。
也就是说,S1把新技能交付的时间成本和数据成本,直接砍掉了两个数量级。这不是“快了一点”,是“快了一个量级”。
长程任务执行,理解意图和复刻动作的本质区别
S1支持最长10分钟的长视频演示作为上下文,能处理换盆植物这种需要连续几十个操作步骤的复杂任务。在任务执行过程中,它做的是三件事:判断当前进度、跨已有技能组合适配、出错了自己纠错补全。核心逻辑是理解演示视频里“想干什么”,而不是逐帧复刻“怎么干的”。
传统微调后的VLA本质上是行为克隆。它复刻的是训练数据里的固定动作序列,一旦执行过程中环境发生了训练时没见过的小偏移,整个序列就断了。Skild的公开测试显示,在动态环境下,传统语言Prompt VLA的性能下降幅度最高达到S1的3倍。
差距的根源在于,S1学到的是任务意图层面的泛化能力,而传统路径学到的是特定场景下的动作轨迹。环境一变,前者能重新规划,后者直接卡死。
跨本体部署,一个大脑和每台机器都要单独练
S1的产品定位是一句话:“Any robot, any task, one brain”——同一套模型权重,不做任何定向微调,就能适配机械臂、四足机器人、人形机器人等完全不同的具身体态。
传统VLA的部署逻辑是,每换一款新硬件,就得重新采集一遍这款硬件的专属交互数据,单独做一轮微调适配。硬件形态稍有变化,老模型就不能直接用,数据和训练成本随硬件种类线性增长。
跨本体部署本身的贡献占比在整条代差链里不算最大,但它的价值在于让前面三个环节积累的能力可以快速规模化复制,不让硬件适配成本把前面的效率优势抵消掉。
结论:不是谁淘汰谁,是各自占位不同
如果只看一个数字:S1用1次演示做到66%,传统路径用380次演示追平66%,用2000次演示能做到86%。S1的优势是“快”,传统路径的优势是“稳”。
选哪个,取决于你要干什么。如果你的场景是任务种类多、变化快、每个任务都很难凑齐几百次演示数据——比如家庭服务、非标操作——S1的ICL零微调路线显然更匹配。
如果你在做的是工业产线分拣,要求98%以上稳定准确率、7×24小时不间断运行,那传统真机微调路线目前仍然是唯一选项,因为66%在工业场景里连及格线都够不到。
这个代差还有一个不能忽略的前提:S1的ICL能力是在10万小时级预训练数据底座上跑出来的,当数据规模降到1000小时级时,ICL效果反而低于传统语言提示VLA方案。所以这不是一个“随便谁都能复现”的路线,而是“你有10万小时级预训练数据才能入场”的路线。
如果是创业团队或者小规模部署,传统微调仍然是更务实的选择。但如果你有数据底座,S1的ICL路线确实把“看一遍就上手”这件事,从概念推到了可用。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.