网易首页 > 网易号 > 正文 申请入驻

VLA开环盲区,终于被堵上了:40M Corrector让机器人边做边纠错

0
分享至

来源:市场资讯

(来源:机器之心)

机器人抓住积木,正准备往碗里放。就在这时,有人突然把碗挪走了。

人会本能地停一下、看一眼,再重新对准;但不少 VLA 机器人不会。它明明还在接收相机画面,手上却继续执行几百毫秒前生成的旧动作,最后把积木放进空气里。

这不是模型「没看见」,而是它在这段时间里,根本没被允许重新思考。

浙江大学 ACES 实验室 OmniAI 团队与阿里巴巴达摩院的最新工作 VLA-Corrector,盯住了这个长期被 action chunk 掩盖的问题:VLA 一次预测一串动作确实高效,但从开始执行到下一次推理之间,也出现了一块危险的开环盲区。

  • 论文: VLA-Corrector: Lightweight Detect-and-Correct Inference for Adaptive Action Horizon

  • 作者: Yi Pan, Miao Pan, Qi Lu, Jiaming Huang, Man Zhang, Siteng Huang, Xin Li, Jie Zhang, Yongliang Shen, Xuhong Zhang, Wenqi Zhang

  • 单位: Zhejiang University;Alibaba DAMO Academy

  • 论文链接:https://arxiv.org/abs/2607.01804

  • 项目主页:https://zju-omniai.github.io/vla-corrector/

  • 代码:https://github.com/ZJU-OmniAI/vla-corrector

他们给出的答案很直接:不必逼大模型每一步都重算,也别让机器人闭着眼把整段动作做完。给 VLA 加一个约 40M 参数的轻量级 Corrector,让它知道什么时候该继续,什么时候必须停手纠错。


长 action horizon 与严格闭环执行的对比

VLA 明明一直睁着眼,为什么还像没看见?

现在主流的生成式 VLA,常用 action chunk 来摊薄推理成本:模型看一次画面,一口气生成未来一段动作;机器人再从中连续执行前 H 步。H 越大,调用模型的次数越少,动作也更连贯。

代价同样明显。抓取时打滑、插入时偏了两毫米,或者目标被人移动,后面的动作就已经「过期」了。但只要 horizon 还没结束,机器人仍会照着旧计划往下做。小偏差很快滚成大错误,等下一次推理终于到来,状态可能已经偏到救不回来了。

把 H 设成 1,当然可以步步闭环,却等于每个控制步都调用一次 VLA。论文的 horizon sweep 也把这笔账算得很清楚:以 π0.5 为例,拉长 horizon 能把 policy call 降低约 4 倍,但成功率会从约 64% 掉到 49% 以下。

所以,问题并不是再猜一个「最佳 H」。真正该问的是:当前这段动作,什么时候已经不值得信了?

不要一直重规划,

只在动作失效的那一刻接管

VLA-Corrector 没有改动 VLA 主干权重,而是在推理链路外加了一条「监测—打断—纠正」的旁路。

第一步是监测。Latent-space Vision Monitor(LVM)学习一个很局部的问题:执行这个动作后,视觉特征接下来应该往哪个方向变化?在线运行时,它不断比较「预期变化」和相机里「真实发生的变化」。模型不是直接预测像素,而是在信息密度高的 latent space 中预测视觉动态残差。这样有助于减少静态背景,光照的干扰,让模型优先关注对执行任务而言重要的动态部分,降低学习难度的同时还能让预测更加准确。

第二步是打断。如果这种偏差持续出现,而非单帧抖动,系统立刻清空队列中尚未执行的 stale actions。动态阈值、迟滞机制和连续步检查,保证它不会一有风吹草动就停机。

第三步才是纠正。简单地再问一次 VLA,可能只会得到另一段同样出不去的动作。为此,Online Gradient Guidance(OGG)会把刚才检测到的视觉偏差变成梯度信号,只引导中断后的那一次恢复推理,把新动作往更可恢复的方向推。


这套机制最终得到的不是另一个固定 horizon,而是事件触发的自适应 horizon:搬运平稳时,大步往前走;到了抓取、对齐、插入这些容易出错的阶段,随时准备切回短视野纠错。实验中,83.7% 的截断恰好发生在这些关键阶段。

换句话说,它不是在开环和闭环之间二选一,而是把闭环反馈用在了最值钱的时刻。

成功率涨了,调用次数反而还能降

在 MetaWorld 上,给 π0.5 加入 VLA-Corrector 后,平均成功率从 48.70% 提升到 64.35%;在 Very Hard 任务上,提升达到 24 个百分点。

更有意思的是,它并不是靠疯狂增加推理次数换来的。SmolVLA 在 horizon 10 下,成功率从 61.90% 提升到 73.00%,平均 policy call 却从19.27 次降到 15.64 次。原因不难理解:及时扔掉过期动作,远比在失败轨迹上继续浪费整段 chunk 划算。

真实 AgileX PiPER 机械臂上的结果更直观。九项任务的平均成功率从 55.6% 提升到 73.3%;在人为移动物体或目标的扰动恢复任务中,成功率从 40.0% 跃升到 68.3%。而在 LIBERO 上,加入 Corrector 的 few-shot 模型达到97.8%,还超过了 fully fine-tuned baseline 的 96.95%。


这项工作真正值得带走的 insight

过去我们常把 VLA 的可靠性理解成「第一次就预测出完美动作」。但机器人进入物理世界后,动作会反过来改变环境,计划也会随时过期。一个永远不犯错的长动作块并不现实,真正重要的是:系统能不能尽早知道自己已经走偏,并保留打断自己的权力。

VLA-Corrector 给出了一种很有启发的系统分工:大模型负责提出计划,小模型负责审计计划,执行层拥有随时叫停的权力。这可能比一味堆大 backbone 更接近具身智能的可靠落地。

它当然不是万能恢复器。OGG 仍受基础策略能力上限约束。但VLA-Corrector真正的核心在于它能有效抑制错误在开环盲区中被放大,大幅降低VLA policy从错误中恢复的难度。它改变了问题的解法:不再要求 VLA 时时严格闭环,而是让系统在该闭环的瞬间,真的闭上这个环。

一句话概括:机器人未必需要永远不出错,但它必须学会不把错误继续做完。

作者介绍

本工作由浙江大学 OmniAI 团队与阿里巴巴达摩院联合完成,第一作者是浙大准研一的硕士研究生潘翼,研究聚焦 action-chunked VLA 的开环盲区与真实机器人纠错,通讯作者为浙大百人计划研究员张文祺。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
英超第1轮,曼城主场2-1逆转伯恩茅斯,新帅马雷斯卡取得英超开门红。

英超第1轮,曼城主场2-1逆转伯恩茅斯,新帅马雷斯卡取得英超开门红。

奔跑的象牙塔
2026-10-03 12:11:05
布云朝克特:德约真的惊艳到我了,所有套路对他只能用一次

布云朝克特:德约真的惊艳到我了,所有套路对他只能用一次

懂球帝
2026-10-03 04:26:16
这个在中国生活了5年的印度女人,回国后分享自己的真实见闻,被印度网友网暴

这个在中国生活了5年的印度女人,回国后分享自己的真实见闻,被印度网友网暴

怪味历史连连看
2026-10-03 10:47:12
罗马诺曝C罗离队内幕:双方本已和解,为何一场发布会再次翻脸?

罗马诺曝C罗离队内幕:双方本已和解,为何一场发布会再次翻脸?

听我说球
2026-10-02 08:53:27
刚走完长征路的毛主席:瘦骨嶙峋,一脸愁容,衣服破烂,让人心疼

刚走完长征路的毛主席:瘦骨嶙峋,一脸愁容,衣服破烂,让人心疼

小豫讲故事
2026-10-01 06:00:18
张本宇是否后悔,他想回国吗?摆在他面前有三条路!

张本宇是否后悔,他想回国吗?摆在他面前有三条路!

千雪新说
2026-10-02 22:07:17
俄军阵亡名单10天暴涨1万,这场战争已经换了一批人来打

俄军阵亡名单10天暴涨1万,这场战争已经换了一批人来打

史行途
2026-10-02 00:35:23
捧出一个世界第一,毁掉二十年根基。国乒最大的危机,从来不是输球,是二十年根基体系的崩塌!

捧出一个世界第一,毁掉二十年根基。国乒最大的危机,从来不是输球,是二十年根基体系的崩塌!

球童纯议
2026-10-02 08:51:23
果然不简单!空姐下跪后续,网传视频火速被删,博主曝电话被打爆

果然不简单!空姐下跪后续,网传视频火速被删,博主曝电话被打爆

轩逸阿II
2026-10-03 11:55:29
唐国强也没料到,走了35年的前妻,意外让两个残疾儿子承受了恶意

唐国强也没料到,走了35年的前妻,意外让两个残疾儿子承受了恶意

仙味少女心
2026-10-01 10:06:06
演员惠英红团队在巴黎被抢劫,经纪人透露细节:被抢的是品牌方工作人员,可能在机场就被盯上,巴黎司机称机场到市区高速的隧道属高发地段

演员惠英红团队在巴黎被抢劫,经纪人透露细节:被抢的是品牌方工作人员,可能在机场就被盯上,巴黎司机称机场到市区高速的隧道属高发地段

芒果都市
2026-10-02 10:29:52
央国企最大开销不是工资,而是养高管,该动真格了

央国企最大开销不是工资,而是养高管,该动真格了

你在偷看谁
2026-10-02 11:55:35
从万人欢呼到鸡蛋砸脸只用了五个月!匈牙利人:口号能当饭吃吗

从万人欢呼到鸡蛋砸脸只用了五个月!匈牙利人:口号能当饭吃吗

糖逗在娱乐
2026-10-03 10:08:32
令人感到羡慕,87年出生的清华才子王波已升任市委常委

令人感到羡慕,87年出生的清华才子王波已升任市委常委

靓仔情感
2026-10-03 10:01:21
李在明暗示韩国曾统治中原万年言论曝出,日本媒体冷嘲:他对中国“怕不是有啥幻想”,争议迅速发酵

李在明暗示韩国曾统治中原万年言论曝出,日本媒体冷嘲:他对中国“怕不是有啥幻想”,争议迅速发酵

爱竞彩的小周
2026-10-02 04:39:54
台媒:两架F-16V战斗机抵达志航基地后,会立即进入地下机库!

台媒:两架F-16V战斗机抵达志航基地后,会立即进入地下机库!

闻识
2026-10-02 14:17:56
“新能源一哥”跌落神坛!几十万基民亏到怀疑人生,信任碎了一地

“新能源一哥”跌落神坛!几十万基民亏到怀疑人生,信任碎了一地

一曲一场談
2026-09-25 02:57:00
俄罗斯绝密文件流出:一旦与北约开战,中方周边两"邻居"先遭殃

俄罗斯绝密文件流出:一旦与北约开战,中方周边两"邻居"先遭殃

历史点行
2026-10-01 16:58:47
彻底闹僵!葡萄牙7号易主,C罗儿子落选U16,好友:C罗非常不满

彻底闹僵!葡萄牙7号易主,C罗儿子落选U16,好友:C罗非常不满

流年顛簸
2026-10-03 10:43:05
伊拉克宣布实现国家完全主权

伊拉克宣布实现国家完全主权

新华社
2026-10-01 20:28:10
2026-10-03 12:27:00
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4952446文章数 9710关注度
往期回顾 全部

科技要闻

英伟达盘中创历史新高,市值逼近6万亿美元

头条要闻

33岁音乐教师赴泰国后失联 其手机IP曾两次显示在缅甸

头条要闻

33岁音乐教师赴泰国后失联 其手机IP曾两次显示在缅甸

体育要闻

这个讨论了一夏天的问题,马刺有答案了吗

娱乐要闻

假期快乐!贾乃亮晒和甜馨国庆出游照

财经要闻

4亿台电视挂墙落灰 为何没人愿意开了?

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

艺术
时尚
数码
家居
亲子

艺术要闻

赵无极《蓝色夜航》,5275万港元!

挨骂的刘雯,做错0件事

数码要闻

AMD掌机芯片大变革!锐龙Z3系列曝光:Zen 6架构、25mm封装

家居要闻

2026建博会(广州) 公装联探展交流活动

亲子要闻

恶治坏习惯哈哈哈哈哈哈

无障碍浏览 进入关怀版