网易首页 > 网易号 > 正文 申请入驻

GPT-6 丝滑「上身」宇树 G1,斯坦福把机器人控制链封装成了一套「专属 API」

0
分享至


空间记忆接导航,视觉伺服接抓取,全身运动负责落地。

作者丨郑佳美

编辑丨岑 峰

这两天,斯坦福大学 The Movement Lab 和加州理工学院公开了一个有趣的研究项目 HomeBody。

团队把 GPT Astra 接进 Unitree G1,让人形机器人先自己探索陌生厨房,再根据人的指令完成找东西、拿药、扔垃圾和开抽屉等连续任务。

这并不是简单给 G1 加一个大模型助手。机器人事先不知道物体具体放在哪里,它需要在探索过程中记录环境和空间位置,任务开始后再从历史信息里找回目标,决定去哪、找什么,以及接下来调用哪个技能。


更关键的是,GPT Astra 并不直接控制关节。导航、轨迹规划、碰撞检测、视觉伺服和全身控制依旧运行在机器人本地,大模型负责的是任务理解、技能选择和失败后的重新决策。

在全行业都在卷端到端大模型直接吐动作(VLA)的当下,但 HomeBody 项目显然给出了相反的答案。它试图回答具身智能一个充满争议的 核心问题:当 VLM 已经能理解环境、调用技能并处理长任务以后,语言到动作之间那层原本很重的任务策略,还需要保留多少?

把机器人控制链做成标准化接口、用分层治理抗衡端到端,会是具身智能走向实用化的最优工程解法吗?

HomeBody 后面的整套架构设计,正是沿着这个追问展开的。

01


一套机器人 API

这套系统往前走的一步,并不是把 GPT Astra 接到 G1 的关节控制器上,而是重新设计了大模型和机器人身体之间的接口。

Astra 每次做完判断后,会通过结构化 tool call 选择一个技能,同时给这个技能提供它真正需要的参数。

不同动作对应不同的命令空间:Pick 接收当前图像中一个归一化到 0–1000 的二维点,再指定左手或右手,Navigate 接收地图坐标系里的二维目标点和朝向点。

Place 使用机器人躯干坐标系中的三维释放位置、执行手以及释放距离。抽屉操作则把视觉对准、挂住把手和向后行走封装成一个完整技能。


这里的设计很关键,因为它刻意不让 VLM 输出机械臂末端的连续轨迹。大模型只在语义空间里表达我要操作哪个目标,技能接口再把这个意图逐层变成机器人能够执行的几何约束。

这样一来,Astra 不需要理解 G1 的每个自由度,也不需要知道逆运动学求解器怎么工作,它只需要知道当前有哪些能力,以及每种能力需要什么参数。

这和端到端 VLA 的区别也就在这里。VLA 通常需要学习从视觉和语言直接映射到动作空间,动作分布、机器人本体和训练数据会紧密耦合。

这里把中间层拆成显式接口后,抓取可以由解析方法实现,导航可以接传统规划器,某个新技能也可以来自强化学习策略。只要输入输出遵循同一套协议,上层 VLM 并不需要知道底层究竟用了哪种控制方法。

这种设计把机器人扩展能力的难点从重新训练整条策略,转移到了接口本身能不能表达任务需要的状态。随后麻烦很快就出现了:二维图像点可以告诉 Pick 抓什么,却无法告诉 Navigate 几分钟前看到的药瓶究竟位于房间哪一侧。

一旦任务跨越多个房间位置,VLM 就不能只依赖当前相机画面,它需要把视觉语义和真实世界的米制坐标接起来。

02


把视觉历史放进统一坐标系

G1 在执行任务前先探索环境,技术意义就在这里。

探索过程中,系统同步保存相机观测、D435i 双目数据、LiDAR 与 SLAM 信息、机器人关节姿态,以及 Astra 选择过的航点。

随后,Astra 参与 Real2Sim 流程,把这些观测整理成 Isaac Sim 中的数字环境。SLAM 提供实测几何约束,视觉数据补充物体和场景语义,关节状态与航点则把观测重新绑定到机器人自身视角。

这一步解决的是两个坐标体系之间的断裂。

VLM 看到的是图像坐标,例如药瓶曾经出现在某张照片右下方;机器人导航需要的却是地图坐标,例如目标位于当前身体前方 4.2 米、左侧 1.1 米。单纯保存历史图片无法直接完成这种转换。

系统运行时先通过 Super Odometry 得到 G1 在现实 SLAM 地图中的状态,再利用 ICP,也就是 Iterative Closest Point,把 SLAM 点云与 Isaac Sim 中的重建环境配准。完成配准以后,现实地图和数字环境共享一套空间关系,探索阶段保存的 ego keyframe 也能绑定到这个坐标系。

于是,空间记忆实际上被拆成了两层。

一层是语义记忆,保存某张关键帧里出现了什么;另一层是度量几何,保存拍摄这张图时机器人位于哪里。收到拿药任务后,Astra 可以先从历史观测里恢复药瓶或抽屉对应的视觉线索,再沿着绑定的空间位置让 Navigate 返回此前记录过的区域。

这比把几十张历史图片直接塞进 VLM 上下文稳定得多。语言模型擅长判断某个物体和任务有没有关系,但机器人要走过去,还需要尺度、方向和可达区域。HomeBody 把这部分交给 SLAM 和 Real2Sim,让 VLM 操作的是已经被空间化的记忆。

Real2Sim 在这里承担的也不只是场景重建。官方给出的对比显示,仅靠人工拍摄视频进行重建时,房间尺寸需要根据视觉外观估计;加入机器人自身采集的 SLAM 几何以后,房间布局和尺度受到实测点云约束,数字环境才适合继续给导航和空间推理使用。

不过,这套空间记忆主要解决的是目标已经离开视野以后怎么重新找到它。机器人真正走到抽屉前,问题会从米级导航突然收缩到厘米级操作:三维位置稍微偏一点,手就可能从瓶子旁边擦过去。

因此下一层不能再靠地图处理,需要把二维视觉、深度恢复、机械臂规划和在线纠偏接成另一条闭环。

03


从一个图像点到抓住物体

Pick 技能的输入非常简单:Astra 给出图像中一个 0–1000 范围的二维点,并指定使用哪只手。

但这个二维点不能直接驱动机械臂。系统先用该点提示分割模块,把目标从背景中切出来,随后 Fast-FoundationStereo 根据 D435i 的双目图像计算深度。

得到目标区域的深度以后,再利用相机标定关系,把 mask 内的像素从相机坐标投影成三维几何,系统据此通过解析方法生成抓取姿态。

接下来进入运动规划。机械臂从当前姿态移动到抓取姿态时,规划器生成 spline reference,并使用 minimum-jerk timing 约束轨迹,让速度和加速度变化保持平滑。

然后沿轨迹逐点求逆运动学,同时检查整条 swept motion 的碰撞间隙。换句话说,系统检查的不是终点会不会撞,而是机械臂从起点移动到终点扫过的整个体积是否安全。


但这种离线规划仍然解决不了运动过程中的视觉漂移。

人形机器人靠近桌子时,身体本身会移动,头部相机的视角也会改变。最初投影得到的三维目标即使只偏几厘米,也足以让抓取失败。系统因此继续使用 SAM 2.1 跟踪目标,并结合 SAMURAI 的 memory selection 维持跨帧目标状态,再通过 visual servoing 根据新的视觉位置持续修正接近方向。

这里出现了一个很重要的闭环分层。小范围视觉误差直接由 servo loop 修正;机械手闭合却没有建立接触时,Pick 技能可以换一个 grasp candidate,或者改变机器人站位后重新规划;这些尝试有明确的次数边界。

只有局部恢复已经无法处理,技能才会把失败原因返回 Astra,让 VLM 决定重新定位、换目标或者调整任务顺序/大模型因此没有进入每一次纠偏。


它负责的是离散任务状态转移,本地模块负责连续状态稳定。两者时间尺度也完全不同:手臂和手部控制命令运行在 250 Hz,AMO 每 5 个控制 tick 更新一次,相当于 50 Hz。

GPT Astra 的远端推理则处在秒级。把三种尺度硬塞进同一个策略里,网络抖动和模型推理时间会直接影响身体控制;现在它们被分开以后,大模型停顿主要发生在技能切换处。

抽屉操作则把这种分层推到了全身控制。机械手挂住把手后,如果只让手臂向后移动,很快就会遇到工作空间和身体平衡限制。

系统会让机器人向后走,同时维持上肢操作目标。这里使用的 AMO 本身是一套将 Sim2Real 强化学习和轨迹优化结合起来的全身控制框架,训练目标之一就是让 G1 在面对超出常规分布的上肢目标时,仍然能够通过下肢和躯干调整扩大可操作空间。

到这一步,整套技术链才真正闭合:VLM 输出任务级目标,空间记忆把历史视觉变成地图位置,感知模块把二维目标恢复成三维几何,规划器生成可执行轨迹,视觉伺服吸收局部误差,全身控制器再负责让这些动作在真实 G1 上保持稳定。

04


机器人内部的接口层

这套系统目前还有很明显的工程边界。Real2Sim 会增加部署准备和 API 成本,Astra 的远端推理会在技能之间产生停顿,本地感知和规划目前需要一台 RTX 4090 笔记本运行,更重的视觉模型会继续推高计算需求。

长时间任务还受到机械臂工作空间、手部舵机发热以及硬件耐久度限制。更大的问题来自技能覆盖范围。

Astra 可以重新安排 Pick、Place、Navigate 和 Open Drawer,却不能仅靠语言推理生成一种从未实现过的接触动力学。技能库没有擦桌子,就无法因为一句指令自动获得稳定的擦拭控制;没有处理柔性物体的控制器,也不能靠上层规划弥补底层能力空缺。

但这种限制反过来也说明了它的架构方向。这里没有要求一个 VLA 同时学习空间记忆、任务分解、三维视觉、抓取、碰撞规避和全身动力学,而是把这些问题拆成各自适合的表示和控制频率,再通过显式接口连接起来。

VLM 面对的是技能和状态,SLAM 面对的是几何空间,视觉模型面对的是像素与深度,运动规划器面对的是轨迹约束,AMO 面对的是整具身体的动力学。

人形机器人因而开始出现一种更接近复杂软件系统的结构:高层模型负责离散决策,空间系统维护外部状态,技能提供标准化调用接口,高频控制层承担物理稳定性。

HomeBody 目前展示的能力还有限,但它提出的问题已经很具体。

接下来具身智能的竞争可能不只是谁能训练出更大的动作模型,还包括谁能设计出更合理的技能接口、更稳定的空间状态表示,以及更清晰的高低频控制边界。

https://tml.stanford.edu/homebody/

https://github.com/Stanford-TML/homebody

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
2-0!1亿先生开张,渣叔激活维尔茨,德国知耻后勇,终结2场不胜

2-0!1亿先生开张,渣叔激活维尔茨,德国知耻后勇,终结2场不胜

我的护球最独特
2026-10-02 04:53:06
三四名决赛还没开打,U23国足先迎来致命坏消息,亚运会季军悬了

三四名决赛还没开打,U23国足先迎来致命坏消息,亚运会季军悬了

零度眼看球
2026-10-02 07:08:06
上海知青与苗家妹子分离40载,40年后当了官,得知自己已儿孙满堂

上海知青与苗家妹子分离40载,40年后当了官,得知自己已儿孙满堂

温情邮局
2025-03-31 16:34:05
18比5通过!以色列选举委员会下令:禁止所有阿拉伯政党参选!

18比5通过!以色列选举委员会下令:禁止所有阿拉伯政党参选!

麓谷隐士
2026-10-02 00:05:07
今日!CCTV5直播中国女足+中国金花出战亚运会,5+转国足,网络转中网+斯诺克+U17国足+欧国联等

今日!CCTV5直播中国女足+中国金花出战亚运会,5+转国足,网络转中网+斯诺克+U17国足+欧国联等

晚池
2026-10-02 00:16:55
曾志伟:我睡过她!扒开了“京圈交际花”,周冬雨的私生活遮羞布

曾志伟:我睡过她!扒开了“京圈交际花”,周冬雨的私生活遮羞布

无人倾听无人倾听
2026-10-01 20:25:23
微信转账限额规定

微信转账限额规定

匹夫来搞笑
2026-09-30 06:58:09
退休金拿到这个数就算知足,80%老人达不到,看看你够吗

退休金拿到这个数就算知足,80%老人达不到,看看你够吗

健身狂人
2026-10-01 20:47:23
菲律宾全国开始大罢工,要求中国帮忙度过难关,这次我们该不该帮

菲律宾全国开始大罢工,要求中国帮忙度过难关,这次我们该不该帮

喜你成疾药石无医
2026-10-01 03:09:59
海南龙凤胎日夜啼哭,医院查不出病因,保姆查看监控后发现真相

海南龙凤胎日夜啼哭,医院查不出病因,保姆查看监控后发现真相

悬案解密档案
2025-05-19 14:35:42
央视直播国足热身赛时间表:10月2日,CCTV5+直播国足PK巴勒斯坦

央视直播国足热身赛时间表:10月2日,CCTV5+直播国足PK巴勒斯坦

薇说体育
2026-10-01 16:46:33
我们都被课本骗了几十年:白求恩根本不是普通好人,当拨开课本简略的文字才发现,这段传奇不能只用善良概括

我们都被课本骗了几十年:白求恩根本不是普通好人,当拨开课本简略的文字才发现,这段传奇不能只用善良概括

回京历史梦
2026-10-02 08:35:16
4-0!2-0!中国香港队豪取两连胜,拿满6分锁定第一,PK柬埔寨争冠

4-0!2-0!中国香港队豪取两连胜,拿满6分锁定第一,PK柬埔寨争冠

绿茵舞着
2026-10-02 00:09:39
泽连斯基走出总统府,画面传到俄军指挥中心,基辅无秘密冒头就打

泽连斯基走出总统府,画面传到俄军指挥中心,基辅无秘密冒头就打

吃瓜小侦探
2026-10-01 18:53:55
卢璐痛别刘欢!未来的岁月里,她会做好3件事

卢璐痛别刘欢!未来的岁月里,她会做好3件事

细品名人
2026-10-02 06:13:32
穆帅不想卷入C罗和葡萄牙主帅的争论!网传穆帅评论C罗在葡萄牙队处境的言论,穆帅亲自出面辟谣

穆帅不想卷入C罗和葡萄牙主帅的争论!网传穆帅评论C罗在葡萄牙队处境的言论,穆帅亲自出面辟谣

福酱的小时光
2026-10-02 07:24:21
苦战163分钟!中网金花德比:郑钦文2-1险些爆冷,下一轮对手出炉

苦战163分钟!中网金花德比:郑钦文2-1险些爆冷,下一轮对手出炉

侃球熊弟
2026-10-01 12:18:01
盘一盘主持人阿丘背后的中华文促会,相当劲爆……

盘一盘主持人阿丘背后的中华文促会,相当劲爆……

基本常识
2026-10-02 08:40:08
斗胆预测:继房贷贴息后,楼市“王炸”大招已在路上了

斗胆预测:继房贷贴息后,楼市“王炸”大招已在路上了

专业聊房君
2026-09-30 17:09:56
殡葬师提醒:亲人刚咽气的10分钟内,必须做对的4件事

殡葬师提醒:亲人刚咽气的10分钟内,必须做对的4件事

宝哥精彩赛事
2026-10-01 21:27:18
2026-10-02 10:23:00
AI科技评论 incentive-icons
AI科技评论
点评学术,服务AI
7689文章数 20788关注度
往期回顾 全部

科技要闻

“分手”15天后,华为与赛力斯签约新五年

头条要闻

迪拜航空安全事件疑点重重 副驾驶用何物刺伤机长未知

头条要闻

迪拜航空安全事件疑点重重 副驾驶用何物刺伤机长未知

体育要闻

“今天的表现,我们可以昂首离开球场”

娱乐要闻

奚梦瑶晒四太豪礼!22只龙凤镯近300万

财经要闻

智谱发上亿Token 能挽回开发者信任吗?

汽车要闻

2027款极氪001将于明年一季度上市 现款猎装同步推新配色

态度原创

手机
家居
健康
艺术
公开课

手机要闻

缓解折痕加深:苹果首款折叠iPhone Duo支持更换保护膜

家居要闻

2026建博会(广州) 公装联探展交流活动

刷酸祛痘,为什么有人翻车?

艺术要闻

第四届中国美术奖铜奖获得者——李卓

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版