网易首页 > 网易号 > 正文 申请入驻

智元发布原生世界动作模型,首次验证Scaling路径!

0
分享至


机器人前瞻(公众号:robot_pro)
作者 钟宸
编辑 漠影

机器人前瞻9月10日报道,昨日,智元发布了原生世界—动作模型(World Action Model,WAM)GE-Act 2.0。

智元称,GE-Act 2.0的所有模型参数,包括视觉表征、未来生成、动作预测等核心组件均从随机初始化开始,在具身操作数据上从头训练。

训练完成后,模型不针对评测任务做任何微调和示范,直接在陌生场景、陌生物体上,接受语言指令跟随、多技能操作和陌生环境泛化等真机零样本(Zero-shot)检验,覆盖100项原子任务、20类技能、两种机器人本体。

结果显示,随着数据规模扩大100倍,模型不仅原有技能更稳定,还逐步解锁了此前完全无法完成的新任务,包括折叠毛巾、嵌套纸杯、拔插笔盖、插花等较精细动作。

智元称,原生世界—动作模型的Scaling路径首次被系统性验证。

一、可在复杂场景完成任务,展现长程任务能力

在相同的零样本OOD协议下,智元评估了GE-Act 2.0在目标对象、颜色、大小、形状、位置和顺序方面的指令理解能力。实验表明,该算法能够在杂乱的场景中准确选择目标对象,且能够遵循习得动作偏好(Learned Action Biases)不同的指令,并且能够通过指令组合使能力泛化到新的任务场景中。

首先,GE-Act 2.0可以在复杂场景中执行指令。在智元展示的视频中,模型可在杂乱的物品中识别指令所需的正确物品,并执行夹起的操作。

且该模型能够遵循更复杂的“抓取和放置”指令,结合物体和颜色的区别,正确识别需要移动的物体以及放置的位置。在智元展示的视频中,搭载该模型的G1-OP可将绿色苹果放到绿色的盘子中,并将橙子放到橙色的盘子中。

其次,GE-Act 2.0展现了避免习得动作偏好的能力。在视频中,即使鞋子在鞋盒旁边,G1-OP会遵循把杯子放进鞋盒的指令。智元指出,该策略遵循指令对象-目的关系,而非场景暗示的关系。

同时,模型还能够打断原来的指令,执行最新的指令,在智元展示的视频中,G1-OP可在取消拿起绿色杯子的指令后继续执行拿起蓝色杯子的指令,且进行了连续两次取消,但从视频来看,杯子差一点就要被拿起,且G1-OP显得有些“手忙脚乱”。


GE-Act 2.0还能够在非标准场景中,通过执行连续的单步指令,实现零样本泛化能力,从而完成全新的长程任务。它能利用语言指导,将熟悉的操作技能转化为新的任务序列,而无需针对特定任务的微调。

在展示的视频中,G1-OP的目标是食物放入托盘中,它可以将苹果、芒果、零食袋以及瓶子分不同步骤放进盘中。

二、重新设计架构,展现跨本体迁移能力

这一模型是怎么做到的?智元对此的解释是,GE-Act 2.0面向具身操作重新设计整套架构,给出了从头预训练的完整方法论。


首先,智元设计了更高效的视觉编码器CoAE,将一帧256×384画面压缩为24个视觉token,仅为DINOv3的十六分之一,同时保留语义、运动与局部结构。

压缩后反推动作的精度与DINOv3、V-JEPA 2.1等高信息量表征接近,在4,000条机器人操作数据的受控测试中,指令—画面匹配准确率达97.95%,为五种对照表征中最佳。

其次,智元采用一步式视觉规划,一次生成完整未来,并让动作误差直接反馈给世界模型。配合高效视觉表征,模型在RTX 5090显卡上生成一个连续动作chunk仅需104毫秒。

最后,GE-Act 2.0采用了知识对齐选择性优化方法(KASO),即一次生成多个可能的未来,只选择与真实动作最一致的结果参与训练。在陌生场景的分布外(OOD)评测中,机器人选对指令目标的比例较基线提高7.5个百分点,最终完成抓取的成功率提高10个百分点。

在数据架构上,GE-Act 2.0提出让每类数据承担合适的学习任务:

  • 使用3.9万小时“指令—视频”数据预训练世界模型,学习环境如何变化,其中包含3,000小时无本体数据(不带动作标注的第一视角与人类操作视频);
  • 以3.2万小时机器人轨迹预训练逆动力学模型(IDM),学习“画面这样变化时机器人做了什么”,其中包含2,000小时失败操作与真实场景部署回流(rollout)数据,不要求成功标签;
  • 最后通过3万小时“指令—视频—动作”完整数据进行联合训练,把两种能力连接起来。


在评测中,GE-Act 2.0把真机零样本表现作为标准:不微调、不示范、不换模型,测试中的场景、背景、光照和物体实例均未进入训练。

在相同训练配方下,最后一阶段分别使用300/1,200/5,000/30,000小时四档数据,智元指出,模型在三方面展现出Scaling:

首先是取得非零成功率的任务,在G1-OP机器人上从39项增至76项,在G2-90D机器人上从24项增至72项。智元指出,折叠毛巾、嵌套纸杯、拔插笔盖、插花等较精细动作在小规模数据训练的模型上无法被理解,而当数据达到3万小时规模时出现显著的能力顿悟。

从智元在技术博客展现的视频来看,G1-OP可在零样本的情况下,完成将倾倒的水瓶扶正的操作。

以及将一个杯子,套至另一个杯子内的操作。


以及擦去桌面油污的操作。


而对于仅贡献训练数据不足2%的G2-90D,该模型依然在零样本的情况下完成指令,诸如摘取笔帽,从视频来看,机械臂能精准识别到笔帽并完成摘取操作,同时右臂依然握住笔杆。


以及把芒果放进容器内的操作,但从视频来看,似乎机械臂并未准确定位到容器中央。

而从任务成功率的数据来看,G1-OP机器人总体成功率从17.1%提升至44.1%,G2-90D机器人从13.4%提升至31.1%,且5,000到30,000小时仍未见明显饱和。


另外,虽然G1-OP机器人贡献超50%训练数据,G2-90D机器人占比不足2%,但后者总体成功率仍随共享数据扩大提升17.7个百分点,出现了跨本体的能力迁移。



最后,微调后的GE-Act 2.0在RoboTwin陌生环境测试中取得60.52%成功率,在GenieSim指令遵循测试中获得0.770分,均超过π0.5、GR00T N1.7等参与比较的模型。

结语:从头训练,验证具身Scaling Law

从GE-Act 2.0的发布来看,智元正在试图回答具身智能领域一个核心但尚未被充分验证的问题:世界—动作模型是否也能像大语言模型一样,走出一条清晰的Scaling Law路径?

答案是初步肯定的。当训练数据从300小时扩展到3万小时,模型不仅在原有任务上表现更稳定,更在折叠毛巾、嵌套纸杯、插花等精细操作上出现了“顿悟”。

不过,G1-OP零样本44.1%的成功率也提醒我们,这条路径虽然被验证存在,但距离真正的应用仍有不小的距离。

跨本体迁移的出现固然令人振奋,说明模型学到的并非某一台机器人的肌肉记忆,而是某种更通用的操作语义,但G2-90D在部分任务中暴露的定位偏差以及数据上的差距,也说明能力在不同本体间的迁移可能并不均匀。

接下来值得关注的,是当数据规模继续扩大一个数量级后,是否还会涌现出现在尚未预见的新能力,以及能否实现更广泛的应用。

技术博客:https://ge-act-v2.github.io/#conclusion

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
iPhone18Pro国内销量炸了,卖这么好,简直没天理

iPhone18Pro国内销量炸了,卖这么好,简直没天理

科技头版Pro
2026-09-29 14:31:30
央视发声,又一女间谍曝光!大量航天机密遭泄露,作案手段太高超

央视发声,又一女间谍曝光!大量航天机密遭泄露,作案手段太高超

少女的烦恼
2026-09-28 22:52:28
亚运会:陈芋汐第4跳失误获第二!卢为女子10米台预赛排名第一

亚运会:陈芋汐第4跳失误获第二!卢为女子10米台预赛排名第一

乒烧泳球
2026-09-29 10:17:49
投票截止!金球奖竞争变天:19岁亚马尔获奖概率升第1 赔率平凯恩

投票截止!金球奖竞争变天:19岁亚马尔获奖概率升第1 赔率平凯恩

我爱英超
2026-09-29 06:54:32
血赚!皇马捡到绝世名帅!穆里尼奥放弃毕生梦想,铁心回归伯纳乌

血赚!皇马捡到绝世名帅!穆里尼奥放弃毕生梦想,铁心回归伯纳乌

澜归序
2026-09-29 09:21:06
官宣!跟腱撕裂!快船遭遇沉重打击

官宣!跟腱撕裂!快船遭遇沉重打击

篮球教学论坛
2026-09-29 10:31:18
马珊珊当选沈阳市市长(附简历)

马珊珊当选沈阳市市长(附简历)

上观新闻
2026-09-29 17:03:24
30岁女博士丧失于雪山深处,父母态度:不认领,就让她死在那吧

30岁女博士丧失于雪山深处,父母态度:不认领,就让她死在那吧

罪案洞察者
2025-09-10 13:22:35
深夜服务区令人心酸!丈夫车内熟睡,妻子彻夜守油箱只为防油耗子

深夜服务区令人心酸!丈夫车内熟睡,妻子彻夜守油箱只为防油耗子

行者聊官
2026-09-29 17:35:50
王励勤没想到,莎莎和大头的接连落败,竟让刘国梁口碑暴涨,开始怀念他了?

王励勤没想到,莎莎和大头的接连落败,竟让刘国梁口碑暴涨,开始怀念他了?

乒乓助手
2026-07-24 01:36:03
雷军把罗福莉升到了小米最高职级!

雷军把罗福莉升到了小米最高职级!

人人都是产品经理社区
2026-09-29 12:08:00
上任以来,特朗普最大贡献就是:亲手促成了中国人对美国的祛魅

上任以来,特朗普最大贡献就是:亲手促成了中国人对美国的祛魅

军机Nova
2026-08-22 00:20:07
四川发布干部任前公示,涉县(市、区)党委书记

四川发布干部任前公示,涉县(市、区)党委书记

掌上金牛
2026-09-29 21:08:03
人到晚年,一定要在还能走动时,把这五件事办了,一旦卧床就晚了

人到晚年,一定要在还能走动时,把这五件事办了,一旦卧床就晚了

小虎新车推荐员
2026-09-29 01:18:45
想不通啊!港一年硕士可同台考编:三年国内读研是不是吃亏?广东网友发帖追问,引发轩然大波

想不通啊!港一年硕士可同台考编:三年国内读研是不是吃亏?广东网友发帖追问,引发轩然大波

火山詩话
2026-09-29 11:32:37
2027 新农合开始缴费!400 元不变!但有三件事和往年不同

2027 新农合开始缴费!400 元不变!但有三件事和往年不同

职场资深秘书
2026-09-29 18:40:49
消息称小米大模型负责人罗福莉晋升至22级,已是小米职级体系最高级别

消息称小米大模型负责人罗福莉晋升至22级,已是小米职级体系最高级别

IT之家
2026-09-28 23:01:22
清华大学宣布:黄仁勋、苏姿丰共同加入

清华大学宣布:黄仁勋、苏姿丰共同加入

快科技
2026-09-29 18:22:08
知名投资人曝刘欢真实死因是肝癌!8月底他曾在餐厅吃饭状态不错

知名投资人曝刘欢真实死因是肝癌!8月底他曾在餐厅吃饭状态不错

一个小豹子
2026-09-27 09:40:19
迷山8天,17岁少年靠喝山泉水走出大兴安岭林区,体重降20斤

迷山8天,17岁少年靠喝山泉水走出大兴安岭林区,体重降20斤

新京报
2026-09-29 10:44:29
2026-09-30 00:12:49
机器人前瞻
机器人前瞻
智东西AI媒体矩阵品牌。机器人前瞻,机器人产业新媒体,专注报道全球机器人创新。
949文章数 19关注度
往期回顾 全部

科技要闻

82亿美元收购!李飞飞将与苏姿丰并肩做AI

头条要闻

老人在景观桥上被虎头蜂蜇伤离世 家属:无人愿意担责

头条要闻

老人在景观桥上被虎头蜂蜇伤离世 家属:无人愿意担责

体育要闻

石雨豪:亚运金牌与背后的十年

娱乐要闻

赌王四房婚礼,何超琼带三房成员现身

财经要闻

央行调整完善若干货币政策工具

汽车要闻

搭华为乾崑ADS 5/设计风格换新 2027款纵横G700售30.49万起

态度原创

亲子
时尚
游戏
公开课
军事航空

亲子要闻

工程车小故事 :分西瓜

早秋外套不用买太多太贵,准备几件长风衣,洒脱高级又百搭

《魔兽:无限》评级已出!要登陆多个主机平台?

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

伊朗最高领袖最新发声:伊朗现已变得独立、强大

无障碍浏览 进入关怀版