网易首页 > 网易号 > 正文 申请入驻

成功率反超GPT-6 Astra!港大团队发布Physical RSI,仅用1%成本

0
分享至


香港大学MMLAB提出了一个非常简洁且高效的自进化具身智能系统基线,“PhysicalRSI 1.0”,登顶RoboDojo。让机器人根据任务改写自己的工具、代码、记忆、与技能,再由物理环境选出更有能力的“下一代”。

PhysicalRSI 1.0在RoboDojo上取得了31.38%的平均任务成功率。相较于GPT-6 Astra在RoboDojo上全量测试一次需消耗20万人民币tokens费用,PhysicalRSI 1.0仅用百分之一的成本,比GPT-6 Astra的成功率相对提升了39.6%。

一、从训练动作模型,到让通用大模型直接控制机器人

通用大模型,开始在机器人评测中超过专用策略。 9 月,GPT-6 Astra在 RoboDojo上取得28.97 Score、22.48%平均成功率,超过报告比较的40个公开机器人策略。直接看图、理解指令、决定机械臂如何运动,正在成为通用大模型的一项新能力。

VLA、WAM 等路线从动作学习和物理预测入手,通用大模型则将语义理解与任务推理带入控制过程。如今,这些路线开始在同一套机器人任务上接受检验。但GPT-6 Astra的成绩也呈现出鲜明反差:总体成绩领先,精密操作成功率却只有4%。 抓取之后怎样调整姿态、如何对准插孔、多步操作如何衔接,仍是机器人必须解决的具体问题。

香港大学MMLAB提出了一个简单且高效的方案,PhysicalRSI 1.0(Physical Recursive Self-Improvement),让通用模型进一步参与这些控制问题的改进:看完一次失败的执行,模型可以修改动作程序、更换工具、调整记忆与技能的调用方式,生成不同的子代智能体,再由环境中的任务表现决定保留哪个版本。

该方案是“System 1–2 协同自进化(System 1–2 Co-Evolution)”,让负责理解与规划的“System 2”改进负责动作执行的“System 1”,同时修改两者协作的Harness。一次任务留下的经验,由此进入下一代智能体实际运行的代码与配置。

团队的目标是为RoboDojo实现一套简洁而且强大的baseline,PhysicalRSI 1.0在项目统一任务的对比中取得36.27 Score、31.38% SR,位列第一。其中最鲜明的差距来自精密操作:GPT-6 Astra的成功率为4%,PhysicalRSI为32.50% 。


▲PhysicalRSI 1.0珠峰成绩图

二、GPT-6 Astra的短板,落在“理解之后”的控制过程

插钥匙就是一个直观的例子。理解“把钥匙插进锁孔”并不难,但机器人需要先抓住钥匙,调整到可用的姿态,必要时在两只手之间交接,再让钥匙与锁孔对齐。前几步取得进展,也可能在最后的插入环节失败。Astra的RoboDojo Precision成功率为4%,说明通用推理能力尚未充分转化为精细控制能力。

在GPT-as-policy设置中,大模型根据观察直接选择运动目标,再由底层接口转成机器人指令。PhysicalRSI 1.0希望把这两层职责组织得更有效:“System 2”负责判断如何完成任务、分析哪里出错;“System 1”用技能模型、控制程序和工具完成具体动作,例如π0.5就只是其中一个可调用的动作工具。

分工之后还需要持续改进。例如,机械臂松开衣服后的回撤路径影响了后续折叠,“System 2”就可以修改回撤程序;下一次执行时,“System 1”直接运行新程序。与此同时,Harness也可以改变“System 2”读取哪些历史、何时检查结果、选择哪个工具。决策方式与执行能力都成为可修改、可评估、可继承的对象。

这就是“System 1–2 Co-Evolution”要解决的问题:将一次任务中的分析,落实成下一代智能体实际运行的程序与配置。环境中的后续表现,检验这次修改是否有效。

三、Self-Harness:让机器人改写自己完成任务的方法

PhysicalRSI 1.0用Embodied Self-Harness实现这套协同自进化。Harness可以理解为智能体的工作程序。它把基模、工具、技能和记忆连接起来:看到什么信息,采用什么计划,调用哪个技能,保留哪些状态,出现偏差后怎样处理。Self-harness 则让智能体自己修改这套工作程序。

叠衣服的版本记录给出了一个具体例子。某个候选版本改动了释放衣物后的回撤方式:下降时,记录机械臂实际经过的关节位姿;松开衣物后,沿这条路径反向返回。参数home和descent每个回合重新测量。下一代继承的是“记录路径并沿路径回撤”的方法,因此衣服位置变化后,程序仍会按当前现场重新建立状态。


Self-harness把这样的修改纳入选择过程:父代读取任务录像、动作记录和评估反馈,生成绑定不同工具、代码、记忆与技能的子代;父代与子代进入环境评估,表现更好的版本留下来,继续产生下一代。 不同候选可以修改不同环节,新增代码也可能被淘汰。这里的“适者生存”,由任务奖励或成功率具体定义。

记基模为F,第k代的完整工作程序与配置为Hₖ,则智能体为Aₖ = Agent(F, Hₖ)。主算法可简写为:

agent = Agent(F, initial_harness())
for k in range(budget):
plan = agent.plan(task) # System 2:理解与规划
trace = agent.act(env, plan) # System 1:执行与反馈
variants = agent.reflect_and_rewrite( # System 2:反思并生成子代配置
task, trace, agent.harness,
editable=(“tools”, “code”, “memory”, “skills”),
)
children = [Agent(F, h) for h in variants]
pool = [agent, *children]
fitness = evaluate_in_environment(pool, eval_tasks)
agent = select(pool, fitness) # 环境选择;继承选中的 harness

F的权重可以保持不变。变化的是H:动作技能、记忆组织、工具接口,以及规划与调用规则。大模型的推理由此能沉淀成程序,程序通过环境反馈继续被修改,选中的子代又具备改写下一代的能力。这给出了递归自我改进的具体对象、更新方式和选择依据。


▲子代继承完整的 harness 配置。System 2 提出修改,System 1 在环境中执行,任务表现决定哪些子代进入下一轮。

在叠衣服的迭代中,不同版本先后探索了回撤路径、腕部对齐、目标选择和布料跟踪。下方录像展示相应行为的变化;共同开发场景上的五个选取节点,SR 从27.5% 提升至 60%,Score从31.5 提升至 61.5。这些记录让“自进化”可以对应到具体版本、具体代码与具体动作。


▲【视频 01|叠衣服的迭代过程】


▲共同开发场景上的五个选取节点:SR 从 27.5% 提升至 60%,Score 从 31.5 提升至 61.5。

四、一套简单有效的baseline,在RoboDojo对比中取得第一

RoboDojo仿真评测涵盖42个任务,考察泛化、精密操作、长程任务、记忆与开放能力。基于此,PhysicalRSI 1.0设计了一套极为简单但有效的基线。


▲PhysicalRSI 1.0 baseline:System 2分析经验并修改Harness,System 1通过技能与工具调用Physical API,执行反馈进入下一轮改进。

这套baseline的结构很直接:多模态基模负责理解、规划和改写harness;code-policy skills、π0.5与工具负责操作;所有动作经Physical API进入环境。例如,代码技能可以把数字识别、排序和抓取串起来,也可以保存被遮挡物体的位置,或安排两只手的交接顺序 。

在相同任务子集、五类能力宏平均的口径下,PhysicalRSI 1.0取得36.27 Score/31.38% SR,高于Astra的 28.86/22.21% 和单独使用 π0.5 的 11.03/6.63%。当前官方快照中总Score最高的其他模型Simate-beta,重算到这一口径后为 31.72/25.74%。PhysicalRSI 1.0的成功率较Astra高8.90个百分点,较Simate-beta高3.42个百分点,约为π0.5的4.53 倍 。

1、精密操作:从抓到钥匙,到真正完成插入。

Precision 维度,PhysicalRSI 的SR为32.5%,为 Astra(4%)的 8.125倍。项目提供的三个 seed 评估截图中,插钥匙成功率为39.33%,π0.5、Astra 和 Simate-beta 均为0%;插管为66%,三个对照分别为3.33%、0%、22%。下方的成功录像可以看到完整的抓取、交接与插入过程。


▲【视频 02|插钥匙:抓取、交接与插入】

以下单项采用截图中的三个seed 均值,每格为Score / SR;基线来自官方对应任务记录。


2、交换积木:先腾出位置,再完成交换,朝向也必须正确。

两块T形积木占着彼此的目标位置,直接搬向目标会发生冲突。PhysicalRSI的程序先找缓冲区,将A移走,再把B放到A原来的位置,最后把A放到B原来的位置;每一步都保留目标朝向。网页评估记录中,这项任务的SR为92.67%,π0.5为0.67%,Astra为18%。视频左侧的π0.5回合最终朝向不满足要求,右侧完成了位置与朝向交换。


▲【视频 03|交换 T 形积木】

3、遮挡后揭盖:把“刚才看见了什么”保存成后续动作可用的状态。

机器人先盖住积木,再按红、绿、蓝的顺序揭开。盖住以后,当前画面已无法直接提供积木颜色;程序需要保存颜色与位置的对应关系,再按阶段调用抓取动作。网页记录中,PhysicalRSI的SR为 100%,π0.5为13.33%,Astra为46%。下方左侧回合最后一次抓杯失手,右侧完成了顺序揭盖。


▲【视频 04|遮挡后的顺序揭盖】

4、符号任务:把识别出的规则接到真实操作上。

截图记录中,解方程的SR为60%,Astra为40%,π0.5为0%;井字棋为94%,Simate-beta为60.67%。这类任务同时要求理解符号关系与完成多步操作。随机数字排序的视频则把控制过程展示得更直接:识别当前数字,按数值排序,分配目标位置,再依次抓取和放置。排序规则写进code-policy skill,动作工具完成每一步搬运。


▲【视频 05|随机数字排序】

这些案例说明了 baseline 的具体作用:用程序表达顺序、空间约束与状态,用技能完成动作,再把任务反馈送回 self-harness 修改过程。π0.5 的动作能力是其中一个组成部分,PhysicalRSI 改进的是组织这些能力的完整智能体。

结语:从一个baseline,走向具身自进化的研究基础设施

RoboDojo 是PhysicalRSI 1.0的第一个主要示例场。项目希望进一步建立具身自进化研究的基本标准:明确智能体可以修改哪些部分,子代如何生成,环境如何评估,哪些修改能够被继承。每一次能力提升,都应能追溯到对应的版本、交互记录与选择过程。

以此为基础,PhysicalRSI 1.0希望提供一套可扩展的具身自进化基础设施:用统一接口接入不同的基模、VLA、工具和物理环境;管理候选智能体及其演化谱系;记录任务反馈,并支持在一致的评估与资源预算下比较不同演化算法。这样,社区可以分别研究记 忆如何影响选择、技能如何跨任务迁移、什么样的变异与选择机制更有效。

这也是香港大学MMLAB团队所期待的principled and fundamental research foundation:把具身自进化变成有明确对象、有共同接口、有可检验过程的基础研究。今天的最小实现从桌面任务出发,后续可以接入更多机器人、接触更复杂的任务,并让来自不同环境的经验参与下一轮进化。

PhysicalRSI 1.0希望为社区提供共同的起点,去探索智能体在更广阔物理世界中持续获得新能力的方法。

项目与更多演示: https://mmlab.hk/research/PhysicalRSI

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
34岁网红自曝靠体毛日入1000美元:每分钟收费约100美元

34岁网红自曝靠体毛日入1000美元:每分钟收费约100美元

热搜摘要官
2026-10-01 06:01:24
7万多股民“踩雷”!联创光电变身“ST联光”,股价一字跌停

7万多股民“踩雷”!联创光电变身“ST联光”,股价一字跌停

华夏时报
2026-10-01 18:24:03
雅尔塔会议上乌军四名一线指挥官同台发声 称俄乌战局已发生根本性转变

雅尔塔会议上乌军四名一线指挥官同台发声 称俄乌战局已发生根本性转变

谈史论今1
2026-10-01 18:11:26
西伯利亚-63℃小卖部:全村约900人,苹果30一个,1斤牛肉10多元

西伯利亚-63℃小卖部:全村约900人,苹果30一个,1斤牛肉10多元

抽象派大师
2026-10-02 04:26:31
女性长期使用情趣用品,身体可能出现哪些不适?不少人缺乏认知

女性长期使用情趣用品,身体可能出现哪些不适?不少人缺乏认知

看世界的人
2026-08-07 09:22:50
董路:我也不知道陈妤颉的名字咋念咋写 但我发现她100米跑了55步

董路:我也不知道陈妤颉的名字咋念咋写 但我发现她100米跑了55步

风过乡
2026-09-30 08:02:15
援乌的“防火墙”逻辑:默茨算的是一笔人命账,魏德尔不讲这笔账

援乌的“防火墙”逻辑:默茨算的是一笔人命账,魏德尔不讲这笔账

民间胡扯老哥
2026-10-02 04:39:31
五百名医生已证实:维生素B12与甲钴胺的真相,最好花点时间看看

五百名医生已证实:维生素B12与甲钴胺的真相,最好花点时间看看

路医生健康科普
2026-08-03 15:25:14
林诗栋也没想到,国乒回国仅 1 天,26 岁王楚钦竟传来另一大好消息

林诗栋也没想到,国乒回国仅 1 天,26 岁王楚钦竟传来另一大好消息

林雁飞
2026-10-01 14:24:28
他播了26年新闻,一次错都没出过;化疗完,他挑了身体最好的一天,回主播台做完了人生最后一次播报

他播了26年新闻,一次错都没出过;化疗完,他挑了身体最好的一天,回主播台做完了人生最后一次播报

LULU生活家
2026-10-02 08:34:49
金日成综合大学80周年校庆!崔龙海、李日焕等老校友穿校服出席

金日成综合大学80周年校庆!崔龙海、李日焕等老校友穿校服出席

IN朝鲜
2026-10-01 14:58:37
小沈阳砸了2亿的大片,捧老婆当导演,观众不买账,预售仅940万

小沈阳砸了2亿的大片,捧老婆当导演,观众不买账,预售仅940万

靠谱电影君
2026-09-30 16:53:51
理想汽车4万人抽奖,唯一中奖是罗永浩:恐怕没多少人信抽奖了

理想汽车4万人抽奖,唯一中奖是罗永浩:恐怕没多少人信抽奖了

王新喜
2026-09-29 20:02:51
兵败如山倒!国产新能源或已证明:中国其实不需要二线豪华品牌

兵败如山倒!国产新能源或已证明:中国其实不需要二线豪华品牌

铭记历史呀
2026-09-20 16:15:46
演都不演了!林诗栋夺金后,恶心一幕出现,连日媒都看不下去了

演都不演了!林诗栋夺金后,恶心一幕出现,连日媒都看不下去了

青青衫书生
2026-10-01 15:59:05
40岁纽约时报总监遭7旬华裔岳父母枪杀,案发原因疑为不满女儿外孙遭受家暴,老夫妇轮流开枪,杀人后平静离开现场

40岁纽约时报总监遭7旬华裔岳父母枪杀,案发原因疑为不满女儿外孙遭受家暴,老夫妇轮流开枪,杀人后平静离开现场

大风新闻
2026-09-29 15:50:25
国庆去法国旅游才发现:没人穿风衣、阔腿裤了!满街都是这3种打扮

国庆去法国旅游才发现:没人穿风衣、阔腿裤了!满街都是这3种打扮

时尚穿搭生活馆
2026-10-01 21:48:27
帮红军在延安活下来的,竟然是一位国民党将领,他是谁?

帮红军在延安活下来的,竟然是一位国民党将领,他是谁?

阿諢体育
2026-09-30 16:39:58
中国把欧盟的最后通牒,反手甩给了冯德莱恩,要打贸易战奉陪到底

中国把欧盟的最后通牒,反手甩给了冯德莱恩,要打贸易战奉陪到底

一曲一场談
2026-10-01 23:14:05
上海的出租车,到了不得不改革的时候了

上海的出租车,到了不得不改革的时候了

朗威谈星座
2026-10-01 09:02:32
2026-10-02 09:16:49
机器人前瞻
机器人前瞻
智东西AI媒体矩阵品牌。机器人前瞻,机器人产业新媒体,专注报道全球机器人创新。
953文章数 19关注度
往期回顾 全部

科技要闻

“分手”15天后,华为与赛力斯签约新五年

头条要闻

有关伊朗制裁问题 中国在联大投下反对票

头条要闻

有关伊朗制裁问题 中国在联大投下反对票

体育要闻

“今天的表现,我们可以昂首离开球场”

娱乐要闻

奚梦瑶晒四太豪礼!22只龙凤镯近300万

财经要闻

智谱发上亿Token 能挽回开发者信任吗?

汽车要闻

2027款极氪001将于明年一季度上市 现款猎装同步推新配色

态度原创

艺术
家居
亲子
健康
教育

艺术要闻

第四届中国美术奖铜奖获得者——李卓

家居要闻

2026建博会(广州) 公装联探展交流活动

亲子要闻

鼓吹国外选精生子,收割大龄剩女的又一利器

刷酸祛痘,为什么有人翻车?

教育要闻

六年级竞赛题:难住不少真学霸

无障碍浏览 进入关怀版