网易首页 > 网易号 > 正文 申请入驻

北大与微软亚研提出 BCP,让模型自己决定何时重规划

0
分享至



在 action chunking 已成为 VLA 标配的今天,「一次执行多少步」几乎被所有工作当作一个固定的超参数。北京大学与微软亚洲研究院的一项新工作指出:这个默认设定本身就是一个重要的失败原因 —— 它让重规划变成了与任务进度无关的周期性调度,当没有任何一次重规划恰好落在关键操作阶段之前时,机器人只能带着一个已经过时的 chunk 进入关键操作环节。

研究团队提出了Bernoulli-Continuation Policy(BCP): 冻结基座 VLA,仅训练一个 16.4M 参数的轻量级 head,把「执行多久」分解为一系列「继续执行还是重新规划」的伯努利决策,并通过 GRPO 从轨迹级结果中进行优化。在 RoboTwin 2.0 全部 50 个任务上,LingBot-VLA 的平均成功率从 89.88% 提升至 93.94%,在 VLA 方法中取得 SOTA;真机挂马克杯任务的成功率则从从 44% 提升至 84%。



  • 论文标题:Continue or Replan? Bernoulli-Continuation Policy Learning for Adaptive Horizon Execution
  • arXiv:2608.03483
  • 项目主页:https://fleetfootwork.github.io/BCP/

一、研究背景:被当成工程细节的决策维度

Action chunking 让 VLA 一次预测未来一段动作序列,而不是逐步预测单个动作,既降低了模型推理的频率,也改善了动作的时序一致性。在 chunk-based VLA 中有两个 horizon:prediction horizon决定模型一次生成多少步动作,execution horizon则决定这些动作中有多少步会被真正执行,执行完机器人再重新观测并规划。

OpenVLA、π_0.5、LingBot-VLA 等主流工作都采用固定的 execution horizon。这在自由空间中的粗粒度运动阶段问题不大——长序列往往更加平滑、稳定;但到了接触、对齐、夹爪闭合这类对精度敏感的阶段,微小的位姿误差就可能迅速累积,机器人必须在进入这些阶段之前重新观测。而固定的重规划节奏无法保证这一点。

为了量化这一现象,研究团队设计了一个phase-shift 实验:所有变体都使用完全相同的 50 步 horizon,唯一的区别在于第一个 chunk 只执行 φ 步就重新规划,此后仍然每 50 步规划一次。换句话说,模型和 horizon 都完全相同,只有重规划边界的落点不同。RoboTwin 2.0 的 50 个任务上的结果如下所示:



最高和最低之间相差 11.3 个百分点,需要注意的是,这里 Upper / Lower Bound 都是 hindsight oracle,在真实部署时不可能提前知道。但这个结果说明了一件很关键的事:replanning timing 本身就是一个很强的决策变量

在 Placing Dual Shoes 任务上,这种差异表现得非常直观:当 φ=32 时,机器人执行了一个已经过时的夹爪闭合动作,最终导致任务失败;而当 φ=23 时,恰好有一次重规划落在关键操作阶段之前,机器人获得了新得观测,因此能够准确完成抓取动作并成功执行任务。同一任务上,最佳相位的成功率为 92%,而最差相位只有 80%。



图 1 同一模型、同一 50 步 horizon,仅改变重规划边界的落点:φ=32 时夹爪闭合幅度过时导致失败,φ=23 时边界恰落在操作阶段前而成功。成功率随相位在 0.80–0.92 间剧烈波动。

更重要的是,最优相位不存在可复用的规律。论文统计了 50 个任务各自的最佳 φ,并做卡方拟合优度检验:χ² = 5.00,p = 0.287,无法拒绝均匀分布的原假设。关键时刻在不同任务、不同阶段出现在不同时间,因此不存在一个固定相位能对齐所有精度敏感阶段。

由此论文提出了核心问题:给定一个已预测的 action chunk,机器人应该执行多久再停下来重规划?

二、方法:三个挑战与三个设计

学习这样一个策略并不容易,论文明确列出三个挑战,并逐条给出对应设计。



图 2 BCP 框架。冻结的 VLA 预测定长 action chunk,Bernoulli-Continuation Head 复用其表征输出一串「继续概率」,据此选定执行 horizon;整体用 GRPO + Replanning-Efficiency Reward 优化。

2.1 候选 horizon 具有前缀共享结构

执行 40 步与执行 50 步时,前 40 个动作完全相同,两者的区别只在于第 40 步之后是否继续执行。标准 softmax 分类器却会把不同候选 horizon 看成彼此独立、无序的类别,从而完全忽略这种天然的前缀共享结构。

Bernoulli-Continuation Head的做法是:输出 M−1 个 logit,经 sigmoid 得到「继续概率」







这种因子分解与 chunk 执行天然具有的嵌套结构高度一致:只有当前 chunk 被连续判断为可信,策略才会逐步走向更长的 horizon;与此同时,相邻 horizon 也天然具有更接近的概率——这正是传统分类策略所缺失的序数归纳偏置。



2.2 per-chunk 监督不可辨识

每一次 horizon 决策都会与后续 chunk 以及之后的决策相互耦合。同一个最终结果可能由多种不同的 horizon 序列产生,因此并不存在唯一的 ground-truth 停止标签。基于这一点,研究团队放弃了监督学习,使用 GRPO 从轨迹级结果中进行优化。





2.3 纯成功率奖励会导致 horizon 塌缩

短 horizon 天然更加保守。如果只使用二值成功率作为奖励,策略很容易退化成频繁重规划,从而浪费昂贵的 VLA 调用。为此,论文设计了Replanning-Efficiency Reward(RER)

首先定义相对效率项,其中 C 表示 VLA 的调用次数,tanh 用于限制数值范围:



  • 失败轨迹奖励归零,与效率无关,因此策略无法通过「又短又失败」套利,任务成功始终占主导;



  • 改善了 group-based 优化。只有二值成功奖励时,如果一个 group 中的轨迹全部成功或全部失败,就无法产生有效梯度;加入效率项后,可以根据 VLA 调用量进一步区分成功轨迹,使全成功 group 依然能够产生非零 advantage。参考轨迹的锚定还保证了当「固定策略成功、自适应策略失败」时,仍然可以得到明确的负向学习信号。只有参考轨迹和全部自适应轨迹都失败的 group 才会被丢弃,从而显著缓解稀疏任务奖励带来的梯度稀疏问题。

三、实验结果

3.1 RoboTwin 2.0:VLA 方法中的 SOTA

以 LingBot-VLA 为底座,在原始成功率低于 90% 的13 个低成功率任务上:

  • Clean:75.15% → 86.23%(+11.08%)
  • Randomized:73.54% → 83.46%(+9.92%)

全部50 个任务

  • Clean:89.88% → 93.94%(+4.06%)
  • Randomized:88.78% → 92.84%(+4.06%)

这一结果在所有对比的 VLA 方法中取得 SOTA,也接近了 WAM 的最佳结果。单任务上提升最显著的是 Hanging Mug:41% → 87%(Randomized 下 36% → 62%);其余如 Blocks Ranking Size(70% → 88%)、Turn Switch(60% → 72%)、Click Alarm Clock(80% → 91%)、Place Object Scale(80% → 91%)均为包含精度敏感抓取、放置或交互阶段的任务。

尤其需要注意的是,BCP 仅在 Clean 设定下训练,直接迁移到 Randomized 设定仍有 +4.06% 的一致增益,说明学到的并不是特定视觉条件下的过拟合,而更接近于「什么时候可以继续信任当前 chunk,什么时候必须重新规划」这类与任务阶段相关的知识。

这种提升在不同底座模型上同样成立:在 ABot-M0 上, 13 任务提升+10.69%(Clean)和+11.77%(Randomized);在 ACT 上则提升 +5.38%。



图 3 RoboTwin 2.0 定性对比。BCP 在关键操作阶段前主动缩短 horizon(40 步 / 20 步)刷新观测,避免带着过时 chunk 执行。

3.2 LIBERO / LIBERO-PRO:任务越难,优势越大

在更强调泛化能力的 LIBERO-PRO 上,BCP 带来了 +6.8% 的提升,相比 AAC 高出 2.9 个百分点,并且在扰动幅度最大的 ×0.4 设定下优势最明显(16.8% vs 11.8%)。



3.3 更多重规划,却更低的总运行时间



Continuation head 每次推理仅带来2.03 ms的额外开销。虽然VLA 的调用次数略有增加,但由于动作执行更加准确、无效运动减少,总执行步数由 269 步下降至 248 步。在 50 Hz 控制频率下综合计算后,整体运行时间反而更低

在与 8 种执行策略(Random、Fixed 20/30/40、Action Trigger、Uncertainty Proxy、AAC、AutoHorizon)的 SR–runtime 权衡对比中,BCP同时取得最高成功率与最低运行时间。Fixed 20 甚至没有超越 full-chunk 基线,说明更短的 horizon 并不天然更优;而 Uncertainty Proxy 与 AAC 因为需要采样多个 chunk 来估计不确定性或熵,运行时间明显更高。



图 4 50 个任务上的成功率–运行时间权衡。BCP(红星)同时位于最高成功率与最低运行时间处;Uncertainty Proxy 与 AAC 因需采样多个 chunk 而运行时间显著更高。

3.4 消融:三个组件逐一验证



通过消融实验可以得到三个非常清晰的结论:

其一,仅训练一个 16.4M 参数的轻量级 head,就能够基本追平微调 442.8M 参数 action expert 的效果(78% vs 79%),两者参数量相差约 27 倍。这直接支持了论文的核心判断——这一类失败很大程度上来自重规划时机的错配,而不一定是基座 VLA 动作生成能力不足。

其二,将 softmax 替换为 Bernoulli-Continuation Head 后,成功率进一步提升 +5%(78% → 83%),验证了显式建模 horizon 的序数关系和前缀共享结构的价值。

其三,加入 RER 后又带来了 +4%(83% → 87%)的提升,同时将 VLA 调用次数从 13.825 降至 10.158,运行时间从 21.55 s 降至 18.17 s。可以看到,在没有 RER 时,BC Head 确实存在向短 horizon 塌缩的保守倾向,对应的 VLA 调用次数也是最高的。

超参数实验还表明,候选 horizon 的粒度同样非常重要:将候选集合从 {15, 20, 25, …, 50} 换成更粗粒度的 {20, 30, 40, 50} 后,成功率从 87% 降至 78%——过于粗糙的候选集合会迫使策略在关键阶段停得过早或过晚。Transformer 深度方面,2 层效果最佳(1 层 82%,4 层 84%,6 层 83%)。

3.5 真机:AGIBOT G1

在 AGIBOT G1 真机上,研究团队以 LingBot-VLA 为基座,每个任务采集 250 条任务特定的遥操轨迹,并与 2000 条通用抓取轨迹联合训练 SFT 策略;随后仅用128 条真实轨迹训练 BCP,基座 VLA 始终保持冻结。在评测时,每个任务在相同的 50 个 seed 上分别进行三次实验:

  • Grasping Bottle(瓶身光滑,抓取位姿容错低):74% →92%
  • Hanging Mug(杯柄与挂钩相对位置误差须 < 2 cm):44% →84%,同期 AAC 为 48%

从执行序列可见,BCP 在接近与操作阶段主动缩短 horizon,在抓取与悬挂动作前刷新观测,从而生成更精确的动作。



图 5 真机 AGIBOT G1。抓瓶子 74% → 92%,挂马克杯 44% → 84%。

四、总结与局限

这项工作的价值并不只是成功率提升了几个百分点,更重要的是,它指出了一个长期以来被当成工程细节的问题:execution horizon 本身就是一个重要、而且可以用很低成本进行优化的决策维度。

当大量工作都在关注「如何把动作生成得更准确」时,这篇论文表明,相当一部分失败其实来自「机器人在错误的时机闭着眼睛继续执行」——而修复这一问题,只需要一个 16.4M 参数的轻量级 head。由于基座 VLA 全程冻结、即插即用,并且单次前向即可得到结果,BCP 对已经部署的 chunk-based VLA 系统具有很直接的迁移价值。

论文也明确指出了方法的边界:BCP 只负责决定什么时候停止执行当前 chunk 并重新规划,并不会修改 VLA 本身生成的动作。它的有效性依赖于基座 VLA 能够生成基本合理、可执行的 action chunk;如果预测出的动作本身就是错误的,那么仅仅调整 execution horizon 或重规划时机,依然不足以纠正整条轨迹。

作者简介

作者团队来自北京大学和微软亚洲研究院,共同一作 Weichen Xu 为北京大学在读博士生,目前在 MSRA 实习,共同一作 Zhenhua Liu 为 MSRA 高级研究员,通讯作者 Jiaolong Yang 担任 MSRA 资深研究员主管,研究方向是3D视觉和具身智能。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
越扒越有料!Selina近照曝光, 体重超160斤,大半网友都只看表面

越扒越有料!Selina近照曝光, 体重超160斤,大半网友都只看表面

情感大头说说
2026-08-20 04:41:30
梦鸽李天一赴美不归?看到85岁李双江“现状”,原来杨洪基没说谎

梦鸽李天一赴美不归?看到85岁李双江“现状”,原来杨洪基没说谎

阿纂看事
2024-11-05 11:54:58
杀疯了!10天暴涨68%后断崖下跌!5天跌超35%,四万散户全线深套!

杀疯了!10天暴涨68%后断崖下跌!5天跌超35%,四万散户全线深套!

股侠指北针
2026-08-20 11:27:34
郑爽美国近况被曝!扒完她的财务和官司才发现,不是不想国,而是回不来了

郑爽美国近况被曝!扒完她的财务和官司才发现,不是不想国,而是回不来了

澳洲红领巾
2026-08-19 15:25:13
逆天!21.2+20.2,打爆内线,这大肌肉,女篮该怎么防

逆天!21.2+20.2,打爆内线,这大肌肉,女篮该怎么防

体育新角度
2026-08-19 15:47:08
整容成瘾、陪睡上位?33岁杨紫背后男人曝光,是谁在“使坏”?

整容成瘾、陪睡上位?33岁杨紫背后男人曝光,是谁在“使坏”?

凛若秋霜
2026-07-23 15:06:22
伊朗:最高领袖将现身 在德黑兰主持活动,任命为最高领袖以来尚未公开露面

伊朗:最高领袖将现身 在德黑兰主持活动,任命为最高领袖以来尚未公开露面

每日经济新闻
2026-08-19 08:28:52
CBA最新消息!广东队被曝召回徐昕,广州白给焦泊乔与崔永熙?

CBA最新消息!广东队被曝召回徐昕,广州白给焦泊乔与崔永熙?

绯雨儿
2026-08-20 11:04:30
起猛了,死人大脑操控机械手弹钢琴,无奖励练3天,17天没忘

起猛了,死人大脑操控机械手弹钢琴,无奖励练3天,17天没忘

机器人大讲堂
2026-08-18 08:00:03
谢霆锋现身北京正大中心!穿西装踩休闲鞋笑容满面,这商人范绝了

谢霆锋现身北京正大中心!穿西装踩休闲鞋笑容满面,这商人范绝了

奇怪的鲨鱼们
2026-08-20 03:40:39
赵薇还有脸出来?与女儿同框,小四月身高超170,大眼睛跟妈妈一样

赵薇还有脸出来?与女儿同框,小四月身高超170,大眼睛跟妈妈一样

八星人
2026-08-18 15:12:30
定妆照满脸沮丧!阿尔瓦雷斯转会僵局全写在脸上

定妆照满脸沮丧!阿尔瓦雷斯转会僵局全写在脸上

甜到你心坎
2026-08-20 02:31:20
为什么60%多的高中生上不了本科?因为他们高中三年,大多踩中这五个坑

为什么60%多的高中生上不了本科?因为他们高中三年,大多踩中这五个坑

好爸育儿
2026-08-14 08:35:33
肺病专家郭亚雄:肺里有痰湿,结节、炎症找上门!一个方子化痰散结、宣通肺气,肺结节慢阻肺都能调

肺病专家郭亚雄:肺里有痰湿,结节、炎症找上门!一个方子化痰散结、宣通肺气,肺结节慢阻肺都能调

大明爱养生
2026-08-20 11:26:37
比库明加还自信!场均19+10要2.8亿,名记:没人认为他是顶薪球员

比库明加还自信!场均19+10要2.8亿,名记:没人认为他是顶薪球员

你的篮球频道
2026-08-19 13:42:49
成了,韩国邀请中国出访,正式官宣!

成了,韩国邀请中国出访,正式官宣!

故事终将光明磊落
2026-08-19 08:36:41
曝75岁郭台铭出轨,女方身份被扒,50岁离异带娃,但手握“王牌”

曝75岁郭台铭出轨,女方身份被扒,50岁离异带娃,但手握“王牌”

社会日日鲜
2026-08-15 09:31:07
耗资2亿、影帝影后扎堆,《空枪》首日票房被吊打,问题出在哪?

耗资2亿、影帝影后扎堆,《空枪》首日票房被吊打,问题出在哪?

娱乐追光侠
2026-08-19 13:03:56
中国正式定名战犯神社,日本哑口无言,西方人恍然大悟!

中国正式定名战犯神社,日本哑口无言,西方人恍然大悟!

吃货的分享
2026-08-20 07:48:10
国产五轴机床已经能造,日本为何还敢限制出口?

国产五轴机床已经能造,日本为何还敢限制出口?

爱看剧的阿峰
2026-08-20 08:29:50
2026-08-20 12:43:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13797文章数 142722关注度
往期回顾 全部

科技要闻

DeepSeek Harness更新多模态支持

头条要闻

许家印被判无期徒刑 恒大集团、恒大地产等案一审宣判

头条要闻

许家印被判无期徒刑 恒大集团、恒大地产等案一审宣判

体育要闻

拥有“儿皇梦”的罗德里,为何选择巴萨?

娱乐要闻

汪峰也没想到章子怡,挖到了一条财路

财经要闻

许家印被判处无期 恒大集团被罚88.2亿

汽车要闻

第二代家庭旗舰的样子 奕境X9预售价29.98万起

态度原创

教育
手机
时尚
房产
本地

教育要闻

2026雅思暑假班怎么选?先搞清楚这四件事,再对号入座不踩坑

手机要闻

9月9日科技春晚 苹果华为小米新品或同天发布

内娱还在三件套的时候,韩综已经卷到“扛大炮”了

房产要闻

265亿资产甩出!三亚老牌地产巨头,正在集体退场!

本地新闻

先导片|攀登不止,让不同的故事在此连接

无障碍浏览 进入关怀版