网易首页 > 网易号 > 正文 申请入驻

让VLA真正跑上机器人:北大团队开源Jetson-PI

0
分享至

来源:市场资讯

(来源:机器之心)

在搭载 RTX 4090 的工作站上运行 Vision-Language-Action(VLA)模型,已经不算一件特别困难的事。

但真正困难的是:如何让几亿乃至数十亿参数的 VLA 模型离开工作站,跑进机器人的机身里,并且保持足够快的反应速度?

对于移动机器人而言,依赖外接高端 GPU 并不是理想方案。一方面,高功耗计算设备会显著压缩电池续航,缩短机器人的工作时间,将机器人应用限制在实验室 Demo 中;另一方面,机器人与计算设备之间的通信还会引入额外延迟,并限制机器人的活动范围。

但如果直接把 π0、π0.5 这样的 VLA 模型部署到机载计算设备(如 NVIDIA Jetson Orin)上,问题同样明显。π0.5 在 Jetson Orin 上完成一次推理大约需要 1.4 秒,对应控制频率仅约 0.7 Hz。机器人不仅动作迟缓,还可能因为推理延迟,在连续动作块之间出现明显停顿。


图 1 不同计算设备的功耗、机器人续航与 VLA 控制频率对比。高端 GPU 能够提供更低的推理延迟,但会显著增加功耗;Jetson Orin 等端侧设备功耗更低,却面临控制频率不足的问题。

针对这一问题,来自北京大学、AIRS 与 PrimeBot Research Institute 的研究团队提出了 Jetson-PI:一套面向低功耗端侧设备的 VLA 实时控制方案。

Jetson-PI 没有简单地继续压缩模型,而是同时从异步推理算法、模型调度和底层推理引擎三个层面入手。在 NVIDIA Jetson Orin 上,它在不损失模型准确率的前提下,将控制频率从 0.70 Hz 提升至 6.06 Hz,相较原生 PyTorch 推理提升 8.66 倍。

这一突破或许意味着,具身智能正在经历从实验室 Demo 到工业级应用的关键跃迁:Jetson-PI 通过持续、实时且高效的端侧推理,延长机器人的有效工作时间,让 VLA 从「能够演示」走向「能够长期工作」。


  • 论文标题:Jetson-PI: Towards Onboard Real-Time Robot Control via Foresight-Aligned Asynchronous Inference

  • 论文地址:https://arxiv.org/abs/2607.12659

  • 异步推理代码:https://github.com/PKU-SEC-Lab/Jetson-PI

  • 端侧推理引擎:https://github.com/PKU-SEC-Lab/Jetson-PI-Edge

端侧 VLA 的难题,不只是「推理太慢」

在传统的同步推理模式下,机器人必须等待模型生成完整动作块,才能开始执行。端侧设备的算力和内存带宽有限,推理延迟会直接表现为机器人的长时间停顿。一种自然的解决办法是异步推理:机器人执行当前动作块的同时,模型并行预测下一个动作块。

这样虽然能隐藏一部分推理时间,却会引入两个新问题。

第一个问题是感知与执行错位。模型预测下一个动作块时,使用的是推理开始时采集的图像。但当推理结束、动作真正开始执行时,机器人和外部环境早已发生变化。推理延迟越长,模型「看到的环境」和动作「发生的环境」之间的偏差越大。对于端侧推理而言,错位问题会更加严重。

第二个问题是反应时间过长。即使推理和动作执行实现了并行,机器人对环境变化的响应速度仍然受完整 VLA 推理延迟的限制。在 Jetson Orin 这类端侧设备上,一次推理可能超过 1 秒,机器人很难及时应对复杂操作中的物体滑动或位置变化。

以往的异步推理方法尝试在时间维度上融合新旧轨迹,从而提升轨迹的平滑度。然而,其动作预测过程仍然存在以上两方面的问题。当部署于边端的 VLA 模型执行叠衣服等复杂任务时,可能会因动作误差而导致任务失败。

Jetson-PI 因而选择了一条不同的路线:不对新旧轨迹进行融合,而是直接预测未来的环境表征,从未来时刻开始预测动作。


图 2 同步推理、朴素异步推理和 Jetson-PI 的执行方式对比。朴素异步推理虽然消除了动作块之间的停顿,却会产生预测—执行错位;Jetson-PI 通过未来修正缓解这一问题。

不预测未来图像,而是修正未来表征

Jetson-PI 的核心方法被称为 Foresight-Aligned Asynchronous Correction,即「前瞻对齐异步修正」。

研究团队训练了一个轻量级未来修正模块。该模块接收两类输入:当前时刻由 VLM 生成的环境表征,以及已经提交给机器人、即将执行的动作序列。在此基础上,它预测这些动作执行完成后,环境在未来时刻对应的 VLM 环境表征。动作专家不再只依据过时的当前观测来预测动作,而是能够从预计的未来时间点开始生成动作序列。

这里有一个关键设计:Jetson-PI 没有尝试生成完整的未来图像,也没有逐层修正 VLM 的全部 KV Cache。前者计算成本过高,后者同样会引入大量额外推理。Jetson-PI 只压缩并预测 VLM 最后一层的环境表示,再把修正信息送入动作专家。整个未来修正模块约有 40M 参数,仅占完整 VLA 模型参数量的约 1%,因此不会给端侧设备带来过大的额外负担。

为了让该模块同时适应不同硬件和不同推理延迟,训练过程中会随机采样未来时间跨度。无论模型部署在 Jetson Orin、Jetson Thor,还是性能更高的 GPU 上,同一套修正模块都可以根据实际延迟调整预测的时间范围。


图 3 前瞻对齐异步修正框架。未来修正模块根据当前压缩环境表征与已提交动作,预测推理完成时的未来环境表征,再由动作专家生成与未来执行时刻对齐的动作。

预测动作,并不需要每次都运行整个模型

引入未来修正后,理论上,完成一次 VLM 环境观测后,系统只需反复调用未来修正模块和动作专家,就能持续生成后续动作。这样可以避免每次生成动作时都重新执行耗时的视觉—语言推理,从而提高机器人的控制频率。然而,由于未来修正模块存在误差,如果长期只依赖未来修正,误差累积会导致动作预测错误。

研究团队重新分析了 VLM 和动作专家在机器人控制中的分工:VLM 的主要作用是重新观察当前环境,校正系统对外部世界的理解;动作专家则负责高频生成动作。

Jetson-PI 因而提出了基于置信度的调度机制。在未来修正模块预测未来环境表征的同时,也输出预测表征的置信度。当未来修正模块给出的置信度高于阈值时,系统跳过 VLM,直接使用修正后的环境信息调用动作专家。由于动作专家推理更快,机器人可以更频繁地生成新动作。当置信度下降至阈值以下时,系统重新调用 VLM,读取最新的摄像头画面,并刷新环境表征、KV Cache 和后续预测所需的状态缓存。

实际测试案例显示,在动作平稳、环境变化容易预测时,置信度通常保持较高;而在抓取、接触和放置等关键步骤中,置信度会明显下降,触发 VLM 重新观察环境。

这相当于让机器人学会判断:「什么时候可以凭借已有认知继续行动,什么时候必须重新看一眼。」



图 4 Jetson-PI 的置信度调度机制。当未来预测置信度较高时,系统跳过 VLM,直接调用动作专家;在抓取和放置等环境变化较难预测的阶段,置信度下降并触发 VLM 更新。

基于 llama.cpp,重做一套端侧 VLA 推理引擎

算法解决了「何时调用模型」的问题,但要让 π0、π0.5 真正达到端侧实时控制要求,底层推理系统同样需要优化。研究团队基于 llama.cpp 开发了 Jetson-PI-Edge,并针对 VLA 的执行特点进行了三项核心优化。

1)计算图复用。传统语言模型的输出长度会随解码过程不断增长,计算图形态会动态变化。VLA 推理则有所不同:当摄像头数量、图像分辨率和动作维度固定时,大部分输入张量的尺寸也是固定的。语言指令虽然长度不同,但通常较短,可以通过 padding 统一到固定长度。Jetson-PI-Edge 因而在第一次推理时构建 CUDA Graph,之后直接复用,避免每轮控制都重复建图。

2)常驻中间缓存。视觉编码器、语言模型和动作专家之间需要传递视觉 embedding、KV Cache 等中间结果。通用推理框架会将这些结果写回 CPU 内存,再由下一个模块重新复制到 GPU。对于内存带宽有限的端侧设备,这类往返传输会产生明显开销。Jetson-PI-Edge 为固定尺寸的中间结果预留 GPU 缓冲区,使 ViT、LLM 和动作专家可以直接复用 GPU 上的数据。

3)Flow matching 展开。π 系列模型的动作专家需要执行多轮 flow matching 去噪。若每一步都单独调用计算图,会产生重复的调度和 kernel launch 开销。Jetson-PI-Edge 将多轮去噪展开到统一的计算图中。虽然第一次建图的成本会增加,但之后可以持续复用,因此更适合机器人长时间运行的控制循环。

在计算图复用、GPU 中间缓存和 flow matching 展开全部启用后,π0.5 在 Jetson Orin 上的单次推理时间降至 412.9 ms,其中动作专家的推理时间从 536.8 ms 降至 123.1 ms。结合置信度调度后,系统反应时间进一步降至 165.1 ms,控制频率达到 6.06 Hz,相较原生 PyTorch 框架提升 8.66 倍。

值得注意的是,系统加速并不是以量化或剪枝为前提。论文中的计算图复用、缓存和展开优化没有改变模型计算本身,理论上还可以与量化、剪枝等方法组合,进一步降低延迟。


图 5 Jetson Orin 上不同优化阶段的延迟、反应时间和控制频率。Jetson-PI 在 Orin 上将控制频率从 0.70 Hz 提升至 6.06 Hz。

延迟越长,未来环境修正越重要

在 LIBERO 的 Spatial、Object、Goal 和 LIBERO-10 四个子数据集上,团队使用 π0.5 对 Jetson-PI、RTC 和 VLASH 进行了比较。在不同异步延迟设置下,Jetson-PI 相比 VLASH 的平均成功率高出 14.8 个百分点,相比 RTC 高出 3.9 个百分点。

随着延迟增大,只预测未来机器人状态的 VLASH 性能明显下降。Jetson-PI 则通过预测未来环境表征,在较长延迟下保持了更加稳定的成功率。以延迟步数 Δ = 9 为例,Jetson-PI 在四个数据集上的平均成功率相较 VLASH 高出 45.6 个百分点,相较 RTC 高出 7.0 个百分点。

这组实验说明,端侧 VLA 的问题并不只是「把推理做快」。当推理延迟无法完全消除时,还需要让模型理解:在这段延迟时间内,机器人执行的动作会怎样改变未来环境。


图 6 Jetson-PI、RTC 与 VLASH 在四个 LIBERO 子数据集及不同异步延迟下的成功率。随着延迟增大,Jetson-PI 的性能更加稳定。

真实机器人完成衣物折叠

研究团队还在 PrimeBot Research Institute 的 X2-W 机器人上进行了真实场景实验。

机器人配备一个头部摄像头和两个腕部摄像头,图像分辨率均为 224 × 224。团队将包含衣物拾取、展开与折叠、整理存放的复杂任务拆分为三个子任务,并以 15 Hz 的频率执行动作。

如图所示,同步推理需要等待完整动作块生成后再继续执行,因此机器人会在动作块之间出现明显停顿,整体执行缓慢。简单异步推理虽然将预测与执行并行起来,减少了停顿,却没有解决感知时刻与动作真正执行时刻之间的偏差,导致动作连续性较差。Real-time Chunking 进一步改善了动作块之间的衔接,但仍然依据已经滞后的环境观测生成动作。在衣物抓取、调整和折叠等对时机要求较高的阶段,感知—执行错位仍可能造成关键动作失败。

相比之下,Jetson-PI 根据已提交动作预测未来环境表征,使新生成的动作与实际执行时刻对齐。图中的机器人运动轨迹更加连续,衣物操作过程更加流畅,同时保持了更高的实时性。

图 7 Jetson-PI 在 X2-W 机器人上执行衣物折叠任务。

Jetson-PI 的定位

Jetson-PI 所关注的,不是继续把 VLA 模型的参数规模推向更高,而是解决一个更接近真实机器人落地的问题:当模型必须在功耗、带宽和散热都受限的机载设备上运行时,如何让它依然具备足够快的反应速度?

这项工作的答案由三个部分组成:用未来环境表征缓解异步推理中的感知—执行错位;用置信度调度减少不必要的 VLM 调用;用面向 VLA 特性的系统优化压缩端侧执行开销。对于强调功耗、续航、活动范围和离线运行能力的移动机器人而言,这套方法提供了一条更加可行的路线:不必把整台高端工作站搬上机器人,也能让 VLA 控制逐步接近实时。

作者介绍

论文第一作者杨泽斌是北京大学人工智能研究院二年级博士生,导师为李萌教授。其主要研究方向为高效具身智能算法与系统、大语言模型高效推理及边缘计算,聚焦算法—系统—硬件协同设计,致力于解决具身智能系统在实际部署中的能效与实时性瓶颈。

他在 NeurIPS、DAC、ICCAD 等 AI 与计算机体系结构顶会上发表多篇一作论文,相关一作工作包括:高效端侧目标导航算法 EfficientNav、具身规划记忆管理系统 KEEP、面向机器人操作的层跳过高效推理框架 DySL-VLA、面向边端信息处理的轻量化语言模型部署系统 MCUBERT,以及面向端侧实时机器人控制的异步推理框架 Jetson-PI 等。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
公务员碾死醉汉,被检方认定过失致人死亡,他不服已再申诉

公务员碾死醉汉,被检方认定过失致人死亡,他不服已再申诉

南方都市报
2026-08-22 17:41:08
斯诺克首席16强出炉!韦克林首轮5-0大胜又收退赛礼,肖国栋4-0夺赛点!

斯诺克首席16强出炉!韦克林首轮5-0大胜又收退赛礼,肖国栋4-0夺赛点!

刘姚尧的文字城堡
2026-08-23 17:02:36
张洪福中超处子球!一天前度过18岁生日,恒大足校双星闪耀

张洪福中超处子球!一天前度过18岁生日,恒大足校双星闪耀

奥拜尔
2026-08-23 20:50:02
三观炸裂!翟欣欣出轨聊天记录流出,尺度大到咂舌,判12年都嫌少

三观炸裂!翟欣欣出轨聊天记录流出,尺度大到咂舌,判12年都嫌少

有范又有料
2025-09-29 14:21:11
王健林这辈子最失败、也最后悔的投资,恐怕就是分别给了王思聪、张艺谋和董明珠每人5个亿

王健林这辈子最失败、也最后悔的投资,恐怕就是分别给了王思聪、张艺谋和董明珠每人5个亿

谈史论今1
2026-08-16 20:23:49
一份“日月同辉”蛋糕,让家长被骂惨了,爱与不爱真的很明显

一份“日月同辉”蛋糕,让家长被骂惨了,爱与不爱真的很明显

熙熙说教
2026-08-23 14:06:30
普京强调俄军正扛着旗帜前进,梅德韦杰夫称乌克兰失去一半人口和20%领土

普京强调俄军正扛着旗帜前进,梅德韦杰夫称乌克兰失去一半人口和20%领土

山河路口
2026-08-22 23:17:21
逆天颜值火出圈,伊拉克副攻吸粉无数!她是战火中走出的全能才女

逆天颜值火出圈,伊拉克副攻吸粉无数!她是战火中走出的全能才女

金毛爱女排
2026-08-23 10:52:57
中国电动摩托车销冠“易主”:上半年卖出38.88万辆,反超雅迪

中国电动摩托车销冠“易主”:上半年卖出38.88万辆,反超雅迪

阿振观点
2026-08-04 05:22:09
谈崩了!多年的道行被他毁了!网友:大师真怒了,还是个武僧?

谈崩了!多年的道行被他毁了!网友:大师真怒了,还是个武僧?

夜深爱杂谈
2026-08-23 19:07:06
刚刚!新华社发文明确指明樊振东身份

刚刚!新华社发文明确指明樊振东身份

最爱乒乓球
2026-08-24 00:15:12
公公跟我们住在一起好几年了,但是我发现,只要家里只有我和公公两个人时,他基本上不在客厅待着

公公跟我们住在一起好几年了,但是我发现,只要家里只有我和公公两个人时,他基本上不在客厅待着

LULU生活家
2026-08-17 08:38:32
内存涨价把电脑圈逼疯了:8GB焊死+单插槽,厂商开始集体"缩水"

内存涨价把电脑圈逼疯了:8GB焊死+单插槽,厂商开始集体"缩水"

叮当当科技
2026-08-24 00:01:16
木村拓哉近照爆瘦,脸颊凹陷!这是咋了?

木村拓哉近照爆瘦,脸颊凹陷!这是咋了?

日本物语
2026-08-22 21:00:34
最可怕的事情出现,全世界达成共识:我国不会打仗,可以随意挑衅

最可怕的事情出现,全世界达成共识:我国不会打仗,可以随意挑衅

历史点行
2026-08-23 14:45:24
荷兰时报:美国禁止ASML向中国销售所有光刻机,荷兰大臣已提出反对意见,但无法阻止法案推进

荷兰时报:美国禁止ASML向中国销售所有光刻机,荷兰大臣已提出反对意见,但无法阻止法案推进

逍遥漠
2026-08-23 17:29:54
原来贵的东西真有贵的道理!网友:当初嫌贵,买完之后直接真香了

原来贵的东西真有贵的道理!网友:当初嫌贵,买完之后直接真香了

另子维爱读史
2026-08-22 21:08:52
U19球员转会费TOP10:布阿迪将大幅刷新约罗纪录,皇马4人上榜

U19球员转会费TOP10:布阿迪将大幅刷新约罗纪录,皇马4人上榜

懂球帝
2026-08-24 00:45:17
问界开始为高频焕新支付昂贵账单

问界开始为高频焕新支付昂贵账单

界面新闻
2026-08-21 19:00:05
全美票选GOAT!詹姆斯得票率21%,科比11%,乔丹得票大幅下滑

全美票选GOAT!詹姆斯得票率21%,科比11%,乔丹得票大幅下滑

冷桂零落
2026-08-23 03:39:00
2026-08-24 01:40:49
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4515855文章数 9350关注度
往期回顾 全部

科技要闻

“英伟达发通知:涨价15%以上”

头条要闻

男子凌晨浏览黄色网站深陷"约炮"骗局 21.8万没了

头条要闻

男子凌晨浏览黄色网站深陷"约炮"骗局 21.8万没了

体育要闻

46岁小罗复出,为什么选了一支意丙球队?

娱乐要闻

王传君的舞台,藏着与乔任梁的过往

财经要闻

加拿大宣布“全额对等报复”美国新关税

汽车要闻

刘苗苗:极狐不押注单一爆款,增长进入体系化阶段

态度原创

教育
房产
本地
公开课
军事航空

教育要闻

我是不是被艺考老师忽悠瘸了?看孩子没有时间复习文化课,我痛啊

房产要闻

两大热盘即将入市!三亚又一批安居房狠货要炸场了!

本地新闻

《牛来》的一声“妈妈”,到底多少人被精神污染了

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

美国批准向韩出售导弹 此前特朗普称与金正恩关系良好

无障碍浏览 进入关怀版