网易首页 > 网易号 > 正文 申请入驻

VLA动作预测必须经过LLM吗?TurboVLA仅0.2B参数,RTX 4090上跑出32Hz在线动作预测

0
分享至



共同第一作者:谢亨义,姚晨飞,来自华中科技大学,研究方向为 3D 视觉。

Project Lead: 梁定康,华中科技大学计算机学院青年教师,研究方向包括自动驾驶,具身智能等。

近年来,视觉 — 语言 — 动作模型(Vision-Language-Action Model,VLA)正逐渐成为通用机器人控制的重要技术路线,但当这些模型真正进入高频闭环执行时,一个矛盾越来越突出:模型越来越大、语义能力越来越强,动作更新却未必足够快。

目前,大量 VLA 模型将大语言模型置于视觉感知和动作预测的中心。每次预测动作时,视觉观测都要先进入数十亿参数的语言主干,与语言指令完成融合后,才能进一步生成机器人动作。这不仅带来了显著的计算和显存开销,也意味着:即使模型采用连续动作专家或并行动作解码器,前面的语言模型依然需要完整运行,难以从根本上消除延迟。

这引出了一个核心问题:对于已经给出明确操作指令的机器人任务,每次动作预测都必须运行一个大语言模型吗?

近期,华中科技大学团队联合华为提出实时视觉 — 语言 — 动作模型 TurboVLA。现有 VLA 通常将大语言模型作为视觉到动作的中间接口:视觉观测先与语言指令在大语言模型中完成融合,再基于得到的多模态表示生成机器人动作,即形成一条 V→L→A 的处理路径。TurboVLA 做了个减法,绕开这一中间接口,让视觉与语言特征直接交互,再据此预测连续动作,形成更直接的 V+L→A 路径。在单张 RTX 4090 上,TurboVLA 仅占用 0.9GB 运行显存,策略延迟为 31.2ms,对应约 32Hz 的在线动作预测频率;LIBERO 配置下的模型参数量仅为 0.2B。



  • 论文题目:TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM
  • 论文链接:https://arxiv.org/abs/2607.27205
  • 项目主页:https://H-EmbodVis.github.io/TurboVLA
  • 代码链接:https://github.com/H-EmbodVis/TurboVLA



图 1:TurboVLA 能够直接运行在本地 RTX 4090 上,在降低网络依赖和部署成本的同时,实现约 32Hz 的在线动作预测。

从加速动作生成,到重构执行路径

传统 LLM-centric VLA 通常先使用视觉编码器提取图像特征,再将其投影到大语言模型的 token 空间,与语言指令一起输入语言模型。随后,模型通常采用两种方式产生动作:一种是将动作离散为 token 并进行自回归生成;另一种是连接独立的连续动作专家,并行预测动作序列。自回归 VLA 需要逐个生成动作 token,因此会继承语言生成的串行解码开销。连续动作专家虽然避免了逐 token 生成,但并没有改变多模态信息的处理路径:视觉观测和语言指令仍然需要经过完整的大语言模型,动作专家最终使用的也是语言模型产生的多模态表示。

换句话说,许多现有工作优化的是动作如何生成,却没有改变动作从何种表示中生成:无论采用哪种动作头,模型仍然需要先运行完整的 LLM。

但对于 “抓取滚筒”“按下订书机”“叠起三个碗” 等具体操作指令,语言的主要作用是描述目标物体、操作类型、属性和空间关系,而不是在每次动作更新时持续进行开放式文本生成、知识推理或复杂任务分解。在这类任务中,模型真正需要解决的是:根据语言指令,从当前视觉场景中找到与任务相关的信息,并将这些信息及时转化为连续动作。

因此,TurboVLA 没有继续将问题局限在动作解码器如何加速,而是将研究重点前移到视觉、语言与动作的连接方式:如果任务指令已经明确,动作预测是否还必须依赖 LLM 表示?



图 2:现有 VLA 先通过大语言模型融合视觉与语言信息,再基于其表示生成动作;TurboVLA 则让视觉与语言特征直接交互,并据此预测动作。

TurboVLA 让视觉与语言直接交互并生成动作

围绕这一思路,TurboVLA 做了个减法,采用了一套简洁而有效的架构。首先,视觉观测和语言指令分别由紧凑的模态编码器处理。TurboVLA 使用 DINOv3 编码多相机视觉观测,并使用 BERT 等轻量文本编码器提取指令语义。随后,模型通过双向视觉 — 语言交互建立任务与当前场景之间的对应关系。一方面,语言信息用于引导视觉特征关注与任务相关的物体和区域;另一方面,当前视觉场景也会更新语言表示,使指令特征能够适应具体环境。交互后的多模态特征再与机器人状态共同输入轻量动作解码器。解码器能够在一次前向传播中并行输出完整的连续动作块,不需要将连续动作离散为 token,也不需要逐步进行自回归生成。

因此,TurboVLA 形成了一条更加直接的 V+L→A 动作生成路径。它不是对现有大型 VLA 进行量化、剪枝或蒸馏,而是从源头简化动作预测所依赖的多模态表示:既保留语言条件控制所需的语义信息,也避免在每次动作预测中运行通用大语言模型。



图 3:TurboVLA 分别编码视觉和语言,通过轻量双向跨模态交互构建任务相关表示,并在一次前向传播中并行预测连续动作块。

实验结果:兼顾操作性能与部署效率

研究团队分别在 LIBERO、RoboTwin 2.0 和真实机器人平台上进行了评测,验证 TurboVLA 能否在大幅降低模型规模和部署成本的同时,保持较强的语言条件操作能力。

LIBERO:仅 0.2B 参数,平均成功率达到 97.7%

在包含 40 个语言条件任务的 LIBERO 基准上,TurboVLA 取得了97.7% 的平均成功率。完整模型仅有0.2B 参数,在单张 RTX 4090 上的运行显存占用为0.9GB,端到端策略延迟为31.2ms。作为对比,在相同 RTX 4090 测试设置下,π0.5 的平均成功率为 96.9%,参数量为 3.4B,策略延迟为 93.6ms。TurboVLA 使用约 6% 的参数量,在取得更高平均成功率的同时,将策略延迟降低至约三分之一。



图 4:TurboVLA 以 0.2B 参数取得 97.7% 的 LIBERO 平均成功率,在单张 RTX 4090 上运行显存占用仅 0.9GB,端到端策略延迟为 31.2ms。

从 50 个双臂任务到真实机器人

在 RoboTwin 2.0 实验中,TurboVLA 仅使用官方 50 个双臂任务的 clean 数据进行联合训练,并在对应的 clean 设置下进行测试,不使用 randomized 场景数据。一个统一的多任务模型取得了60.2% 的平均成功率,超过 π0.5 的 57.0% 和 StarVLA-α 的 50.3%。与此同时,TurboVLA 的模型规模为0.4B,在单张 RTX 4090 上的策略延迟仅为43.4ms

研究团队还在 AgileX Piper 机械臂上测试了抓取滚筒、移开扑克牌、按下订书机和叠碗四项任务。TurboVLA 分别取得 92.5%、80.0%、90.0% 和 87.5% 的成功率,并在相同平台、训练数据和测试协议下均超过 π0.5。

这些结果表明,直接的 V+L→A 路径不仅适用于单臂仿真任务,也能够扩展到双臂控制和真实机器人部署。低延迟与低显存还使策略可以直接运行在本地边缘设备上,减少对远程服务器和网络通信的依赖。



图 5:TurboVLA 仅使用 RoboTwin 2.0 中 50 个双臂任务的 clean 数据进行联合训练,并在 clean 设置下取得 60.2% 的平均成功率。



视频链接:https://mp.weixin.qq.com/s/PfAqwu7kA2Ab0_zlT-4_eQ

绕开语言模型,语言仍然不可或缺

消融实验进一步验证了 TurboVLA 的核心判断。完全移除语言后,模型的平均成功率从 97.7% 下降至 70.8%;将自然语言替换为 Task-ID 时,成功率恢复到 95.4%,但仍低于完整语义指令。这说明语言不只是用于区分任务编号,还提供了目标物体、属性和空间关系等重要语义。

与此同时,直接拼接视觉和语言特征只能达到 95.2% 的平均成功率,而双向视觉 — 语言交互可以达到 97.7%。这表明,TurboVLA 并不是简单移除语言模型,而是用轻量语言表示和显式跨模态交互,保留动作预测真正需要的语言理解与视觉关联能力。



图 6:完整语义指令是多任务机器人控制的关键,而双向视觉 — 语言交互能够更充分地利用视觉与语言的互补信息,优于无语言、Task-ID、直接拼接和单向交互。

总结与展望

TurboVLA 最重要的结论,并不只是 “小模型也能获得较强的机器人操作性能”,而是视觉信息在转化为机器人动作之前,未必必须先经过大语言模型。通过让视觉与语言直接交互并生成动作,TurboVLA 在显著降低模型规模、策略延迟和运行显存占用的同时,仍保持了具有竞争力的操作性能。

这项工作并不否定大语言模型在机器人系统中的价值。对于复杂语义理解、任务分解和高层规划,LLM 仍然具有重要作用;但当机器人根据当前画面持续更新动作时,未必每次预测都需要重新运行 LLM。未来,由 LLM 负责高层规划、TurboVLA 负责低延迟执行的分层系统,可能是一条更兼顾智能与效率的技术路线。TurboVLA 所重新思考的,不是如何让 LLM 更快地生成动作,而是动作生成是否必须经过大语言模型。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
毛毅军出任临时主帅,申花要进军中甲?媒体人呼吁给于汉超机会

毛毅军出任临时主帅,申花要进军中甲?媒体人呼吁给于汉超机会

姜大叔侃球
2026-08-03 17:03:45
东方甄选利润暴涨90倍,与辉同行开了第5家公司:俞敏洪和董宇辉,同时在"去个人化"

东方甄选利润暴涨90倍,与辉同行开了第5家公司:俞敏洪和董宇辉,同时在"去个人化"

商道童言
2026-08-03 09:02:36
李亚鹏女儿李嫣20岁近照曝光!皮肤白皙,气质清冷神似妈妈王菲

李亚鹏女儿李嫣20岁近照曝光!皮肤白皙,气质清冷神似妈妈王菲

韩小娱
2026-08-03 17:37:24
突然发现一个规律:凡是能在大城市站稳脚跟的,父母都做对一件事

突然发现一个规律:凡是能在大城市站稳脚跟的,父母都做对一件事

户外阿毽
2026-08-02 06:15:11
负责人撒谎,被中央考核巡查组当场拆穿!

负责人撒谎,被中央考核巡查组当场拆穿!

吉刻新闻
2026-08-03 23:40:24
原来他已去世14年!因春晚一夜爆红,当过局长,无儿无女太凄凉了

原来他已去世14年!因春晚一夜爆红,当过局长,无儿无女太凄凉了

皮皮电影
2026-08-03 13:01:40
今年找工作,已经不是工资的问题了

今年找工作,已经不是工资的问题了

细说职场
2026-08-03 13:01:54
林彪飞机失事,远在台湾的蒋介石为什么大哭不止?直呼:雨农误我

林彪飞机失事,远在台湾的蒋介石为什么大哭不止?直呼:雨农误我

文史季季红
2026-07-24 09:30:03
只差2分!印度选手金牌梦碎,教练赛后认错:是我算错了

只差2分!印度选手金牌梦碎,教练赛后认错:是我算错了

烟雨洛神生
2026-07-25 23:57:19
秦基伟晚年道出上甘岭真相,喀秋莎绝密生死令击溃美军主力

秦基伟晚年道出上甘岭真相,喀秋莎绝密生死令击溃美军主力

张鼋卤说体育
2026-07-31 22:50:50
87岁钢琴大师带2岁儿子登国际舞台,与小37岁太太生一子一女

87岁钢琴大师带2岁儿子登国际舞台,与小37岁太太生一子一女

小嵩
2026-08-02 12:10:41
生涯的第一次!河北彩花夺走了他们的贞操!

生涯的第一次!河北彩花夺走了他们的贞操!

孤独的独角兽影视
2026-08-02 09:55:13
一瓶啤酒的四个谎言,超市怎么卖,你就怎么被骗

一瓶啤酒的四个谎言,超市怎么卖,你就怎么被骗

富贵说
2026-08-02 16:23:43
至少67人死亡!西班牙飞地休达一天涌入约5万非法移民,现已几乎全部返回

至少67人死亡!西班牙飞地休达一天涌入约5万非法移民,现已几乎全部返回

上观新闻
2026-08-02 12:12:55
5辆豪车撑场、朋友圈晒富豪日常,杭州一老板被新认识的“富二代”借走11.6万后,发现对方父母是普通打工人,并早已是失信被执行人

5辆豪车撑场、朋友圈晒富豪日常,杭州一老板被新认识的“富二代”借走11.6万后,发现对方父母是普通打工人,并早已是失信被执行人

大风新闻
2026-08-03 15:28:10
1949年,一位国军少将带领部队起义,迎接他的解放军首长一露面,他当场愣住了:你不是我五弟吗?

1949年,一位国军少将带领部队起义,迎接他的解放军首长一露面,他当场愣住了:你不是我五弟吗?

人生录
2026-08-04 00:05:09
太亏了?湖南666分考生放弃哈工大拔尖班复读,2026年677分上岸北医临床

太亏了?湖南666分考生放弃哈工大拔尖班复读,2026年677分上岸北医临床

育学笔谈
2026-08-01 21:23:30
不装了,半日狂抛300亿,A股下跌真凶竟是它?

不装了,半日狂抛300亿,A股下跌真凶竟是它?

财报翻译官
2026-08-03 13:18:15
成都交警严查“无证”驾驶,近一个月118人被拘

成都交警严查“无证”驾驶,近一个月118人被拘

红星新闻
2026-08-03 16:05:12
人民币杀疯了!超越美元,三年来最强的一次,中国经济真挺住了!

人民币杀疯了!超越美元,三年来最强的一次,中国经济真挺住了!

飘逸的云朵
2026-08-03 10:31:58
2026-08-04 00:40:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13664文章数 142710关注度
往期回顾 全部

科技要闻

“像魔法一样”的AI,只卖几分钱

头条要闻

银鹭与男子因兑奖发生纠纷后 转账1万元并附言"敲诈"

头条要闻

银鹭与男子因兑奖发生纠纷后 转账1万元并附言"敲诈"

体育要闻

马克龙介入FIFA危机 致电因凡蒂诺勿搞分裂

娱乐要闻

陈璇半蹲采访诺兰惹争议

财经要闻

美日联手,救得了日元吗?

汽车要闻

方程S系列将于成都车展发布内饰 9月上旬新车上市即交付

态度原创

艺术
时尚
手机
本地
军事航空

艺术要闻

颠覆认知!这份中国最美榜单出炉,第一名竟不是九寨沟?看完第一个我就坐不住了!

刘亦菲又美上了热搜!她的“减龄扎发”普通人也可以照着学

手机要闻

想换手机先等等!下月新旗舰将密集发布

本地新闻

神仙也“蓉”漂,哪吒与八仙,皆是成都出品!

军事要闻

东风系列导弹家族罕见同框画面公开

无障碍浏览 进入关怀版