网易首页 > 网易号 > 正文 申请入驻

20%数据超GR00T N1.6、RoboDojo超WAM!StarVLA只用16卡训出全新VLA!

0
分享至



机器人 VLA 还在疯狂卷数据,StarVLA 团队这次却把目光放到了另一个问题上:除了继续 scale 数据以外,能不能让每一条数据都学得更值?

他们最新发布了面向 VLA 的 VLM 底座VLAct。

VLAct 的整个 continued pre-training 只使用开源数据和16张GPU,但成绩相当能打:RoboTwin 2.0 成功率达到92.5%;在 RoboDojo 榜单中超过所有明确标注为 World Action Model(WAM)的模型;面对预训练阶段从未见过的 GR-1 机器人,只使用20%的 RoboCasa-GR1 下游数据,就已经超过 NVIDIA GR00T N1.6 的全量数据基线。模型、Checkpoint、训练代码和 Pipeline 也全部开源。



图 1|VLAct 主要结果一览:RoboDojo、RoboTwin 2.0、RoboCasa-GR1,以及 16 GPUs 与全开源。(项目宣传图)

机器人数据

没法像互联网数据一样“爬”

过去几年,大模型已经证明了一条非常有效的路线:数据更多、模型更大、算力更强,能力就不断往上走。VLA 自然也希望复制这条 Scaling 路线。

但机器人领域有一个绕不开的现实:机器人轨迹不是网页数据,不能从互联网直接爬下来。每条数据都需要机器人真正在物理世界里完成操作,背后往往还有遥操作、数据采集和硬件成本。更麻烦的是,机器人最终面对的是几乎无限的场景、物体、任务和机器人形态组合。

所以 VLAct 并不是想否定 Data Scaling,而是补上另一个问题:在同样的数据预算下,能不能让机器人轨迹在 Backbone 里留下更多可以跨任务、跨 Action Head、甚至跨机器人迁移的知识?



图 2|Naive VLA pre-training 容易绑定预训练场景;VLAct 把目标转向更可迁移的 Action-aware Representation。

一个有点反常识的发现:

Action 学得更好,Backbone 不一定更好

VLAct 真正的起点,来自团队前期实验中一个很有意思的现象。现在很多 VLA 都会从一个 VLM 出发,挂上 Action Head,再用机器人数据继续训练。很自然的想法是:Action 预测越准,说明这次 VLA 预训练越成功。

但实验发现,并不一定。以 RoboTwin 为例,使用 OFT Head 做 continued pre-training 后,如果下游继续使用 OFT,成功率可以从 61.7%提高到 75.8%;但把同一个 Backbone 换成 PI Head,下游反而从 60.5%下降到 55.1%;换成 GR00T Head 甚至从 51.2%降到 28.9%。

换句话说:Policy 在原来的 Head 上变强了,不代表 Backbone 真的变得更通用。



图 3|Action supervision 会直接塑造 Backbone:同 Head 性能提升,并不自动转化为 Cross-head 迁移能力。

原因也很直观。Action Head 和 Backbone 是一起训练的,只用一种 Head 时,Backbone 很容易逐渐学会一种“最方便这个 Head 读取”的 Feature Geometry。对于当前 Policy,这当然很好;但换一个 Action Head、任务甚至机器人后,这些 Representation 未必还能继续复用。论文把这种现象称为head-specific representation collapse。

于是 VLAct 把 continued pre-training 的目标重新定义了一遍:不是训练一个已经很会做动作的固定 Policy Initialization,而是训练一个能被不同 Action Head、不同任务、不同机器人继续利用的 VLM Backbone。

那怎么避免 Backbone 被“带偏”?

围绕这个目标,VLAct 没有重新发明复杂的 Policy Architecture,而是在 continued pre-training 阶段做了三件事。

第一,别把 VLM 原来学会的东西忘了。VLAct 保护 Vision Encoder 和较浅的 LLM 层,同时混入 Caption 数据,让模型在学习 Action 时尽量保住原来的视觉语言先验。

第二,别让一种 Action Head 说了算。VLAct 同时挂上 OFT、PI 和 GR00T 三种连续 Action Head,让它们共同读取一个 Backbone、预测同一套动作。这样 Backbone 想同时服务不同 Decoder,就不能只把信息组织成某一种 Head 最喜欢的形式。更重要的是,预训练结束后这些 Head 全部可以丢掉,下游重新初始化自己的 Action Head。

第三,不同机器人之间,该共享的物理语义就共享。例如“打开/关闭夹爪”在不同机器人上的物理意义高度相似,但不同机械臂的自由度和运动学结构又不能粗暴统一。因此 VLAct 只统一真正一致的 Action 维度,其他部分继续保持 Embodiment-specific。



图 4|VLAct 完整训练框架:Preserve VLM Prior、Multi-head Continuous Supervision、Partially Unified Action Space,下游重新初始化 Action Head。(论文 Figure 3 原图裁切)

RoboTwin 92.5%

RoboDojo 超所有 WAM

最终,这种 Representation 能不能迁移,还是得看结果。在 LIBERO-Plus 上,VLAct 达到82.6%;到了双臂操作的 RoboTwin 2.0,Data Scaling 设置下 Clean 成功率进一步达到92.5%,Random 设置也达到90.8%。

在 RoboDojo 上,VLAct 取得10.66Score 和7.60%的 Success Rate,并超过所有明确标注为 WAM 的参赛模型。也就是说,这套预训练并不是只在某一个机器人、某一个 Benchmark 上有效。

论文还在 Franka 真机上覆盖了单臂短时序、长时序、双臂协同,以及 Novel Object 和 Full Substitution 等 OOD 设置。



图 5|真实机器人评测任务:包括 In-domain 与 Out-of-domain、短时序、长时序和双臂操作。(论文 Figure 11 原图裁切)

20%数据

超过 GR00T N1.6 的 100%

最能体现迁移能力的实验来自RoboCasa-GR1。GR-1 这种机器人在 VLAct continued pre-training 的数据里一次都没有出现过:预训练阶段模型看到的是 Franka、AgileX 等机器人,然后再把 Backbone 拿到 GR-1 上进行下游 Fine-tuning。

结果只使用 20% 的 RoboCasa-GR1 轨迹,VLAct 就达到 49.5%的成功率,已经超过 GR00T N1.6 和 Qwen3VL-OFT 的全量数据基线;当数据提高到 100%时,VLAct 进一步达到 54.0%。



图 6|论文 Figure 5:真机单臂/长时序/双臂结果,以及 RoboCasa-GR1 跨本体迁移;20%下游数据已超过公开 full-data baselines。

Beyond Data Scaling

让每条机器人数据“学得更值”

VLAct 并不是想证明“数据不重要”。机器人数据当然还需要继续 Scale,但由于机器人数据昂贵、稀缺,而且很难完整覆盖真实物理世界,Representation Quality 本身也应该成为 VLA Scaling 的一条独立轴线。

过去大家更常问:“还能收多少机器人数据?”VLAct 希望同时再问一句:“同样这些机器人数据,到底能让模型学到多少可以迁移的东西?”

整个 VLAct continued pre-training 基于 Qwen3-VL-4B,只使用公开机器人数据和 16 张 GPU 完成。目前模型权重、Checkpoint、数据处理及训练 Pipeline 均已开放,希望把一个更适合物理世界、也更 Research-friendly 的 VLM Backbone 交给 VLA 社区。

项目链接





  • 项目主页:https://starvla.github.io/VLAct/
  • 论文标题:Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models
  • 论文地址:https://arxiv.org/abs/2608.27550
  • GitHub:https://github.com/starVLA/VLAct
  • Hugging Face:https://huggingface.co/collections/StarVLA/vlact
  • X: https://x.com/YSenqiao/status/2094260526075302194

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
88分钟准绝杀!96分钟惨遭世界波读秒绝平!9.2亿豪门2-2无缘连胜

88分钟准绝杀!96分钟惨遭世界波读秒绝平!9.2亿豪门2-2无缘连胜

狍子歪解体坛
2026-09-06 23:03:23
央企行贿7610万美金,总统只分到101.17万……

央企行贿7610万美金,总统只分到101.17万……

家传编辑部
2026-09-06 21:28:20
女篮加时74-70逆转捷克女篮 球员评价:2人优秀,2人及格,7人低迷

女篮加时74-70逆转捷克女篮 球员评价:2人优秀,2人及格,7人低迷

篮球资讯达人
2026-09-06 22:30:53
世界杯-中国女篮加时逆转捷克 韩旭22+14杨舒予18分绝平上篮

世界杯-中国女篮加时逆转捷克 韩旭22+14杨舒予18分绝平上篮

醉卧浮生
2026-09-06 22:26:29
多地严查赵一鸣、好想来……

多地严查赵一鸣、好想来……

中吴网
2026-09-06 09:46:34
CHINA GT发生重大撞车起火事故,“救援人员因害怕,放下灭火器后逃离”,对手弃赛冲入火海救人

CHINA GT发生重大撞车起火事故,“救援人员因害怕,放下灭火器后逃离”,对手弃赛冲入火海救人

澎湃新闻
2026-09-06 16:54:03
炸裂!孙宇晨聊天记录曝光,越来越疯狂!

炸裂!孙宇晨聊天记录曝光,越来越疯狂!

财经要参
2026-09-06 19:00:03
3.9秒绝平+决胜1罚!杨舒予18+5成女篮救世主 郑薇:本场MVP给她

3.9秒绝平+决胜1罚!杨舒予18+5成女篮救世主 郑薇:本场MVP给她

颜小白的篮球梦
2026-09-06 22:41:00
24GB+1TB!新机官宣:9月10日,正式发布

24GB+1TB!新机官宣:9月10日,正式发布

科技堡垒
2026-09-06 11:40:33
iPhone 18系列定价曝光:标准版5999元起,Pro版9999元起,Pro Max版10999元起

iPhone 18系列定价曝光:标准版5999元起,Pro版9999元起,Pro Max版10999元起

鲁中晨报
2026-09-06 15:47:03
死在加州路边的阿里总监:42岁,年薪百万,却买不到一张回程机票

死在加州路边的阿里总监:42岁,年薪百万,却买不到一张回程机票

林子说事
2026-09-06 13:39:11
死在加州路边的阿里总监:42岁,年薪百万,却买不到一张回程机票

死在加州路边的阿里总监:42岁,年薪百万,却买不到一张回程机票

小虎新车推荐员
2026-09-06 14:38:40
6岁永久失明,全网心疼的郭斌(高考721分,在武汉求学12年),今天大学报到

6岁永久失明,全网心疼的郭斌(高考721分,在武汉求学12年),今天大学报到

极目新闻
2026-09-06 16:54:51
俄罗斯星链尴尬事:租星链,不给;偷星链,不让;发射星链,不入轨

俄罗斯星链尴尬事:租星链,不给;偷星链,不让;发射星链,不入轨

李未熟擒话2
2026-09-06 07:49:18
周慧敏深夜悲痛发文:9月3日晚,女星周慧敏更新了社交账号

周慧敏深夜悲痛发文:9月3日晚,女星周慧敏更新了社交账号

东方不败然多多
2026-09-06 08:19:23
“葫芦娃爷爷”把7个葫芦全剪了:奶奶头晕病发身体不适;走红后大量游客涌入,甚至有网红扎堆直播,当地:把安宁与清净还给两位老人

“葫芦娃爷爷”把7个葫芦全剪了:奶奶头晕病发身体不适;走红后大量游客涌入,甚至有网红扎堆直播,当地:把安宁与清净还给两位老人

鲁中晨报
2026-09-06 08:03:36
罕见突破!台湾教授万字发文一国两制统一方案,打破岛内多年禁忌

罕见突破!台湾教授万字发文一国两制统一方案,打破岛内多年禁忌

小马姨
2026-09-06 15:41:20
2-0!亚预赛最大冷门诞生!印尼掀翻卫冕冠军,小组头名出线

2-0!亚预赛最大冷门诞生!印尼掀翻卫冕冠军,小组头名出线

绿茵舞着
2026-09-06 22:18:34
财政部将发行特别国债支持8家中央金融企业补充资本

财政部将发行特别国债支持8家中央金融企业补充资本

界面新闻
2026-09-06 19:20:31
演员吴彦祖发生撞车事故,现场画面公布

演员吴彦祖发生撞车事故,现场画面公布

新民周刊
2026-09-06 13:08:11
2026-09-07 00:23:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13933文章数 142729关注度
往期回顾 全部

科技要闻

DeepSeek被曝将采购16万颗华为昇腾950DT

头条要闻

CHINA GT发生重大撞车起火事故 救援人员因为害怕逃离

头条要闻

CHINA GT发生重大撞车起火事故 救援人员因为害怕逃离

体育要闻

3.9秒绝平!杨舒予18+5成女篮救世主

娱乐要闻

杨紫获白玉兰影后!爸爸:累了就回家

财经要闻

亏损高达200亿,昔日彩电霸主走下巅峰!

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

数码
教育
房产
亲子
公开课

数码要闻

网购诈骗方式升级:新套路让人防不胜防!近万元RTX 5080变保温杯

教育要闻

2905人!长江大学2026级研究生新生大数据出炉!

房产要闻

突发重磅!海口出台楼市新政!

亲子要闻

工程车小故事:淘气的小警车

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版