知识隔离视觉-语言-动作模型:训练快、推理快、泛化更强
Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better
https://www.pi.website/download/pi05_KI.pdf
![]()
![]()
摘要
视觉-语言-动作(VLA)模型通过将端到端学习与来自网络规模视觉-语言模型(VLM)训练的语义知识迁移相结合,为训练物理系统(如机器人)的控制策略提供了一种强大的方法。然而,实时控制的约束往往与VLM的设计相悖:最强大的VLM拥有数百亿或数千亿参数,这给实时推理带来了障碍,并且它们操作的是离散令牌,而不是控制机器人所需的连续值输出。为应对这一挑战,近期的VLA模型采用了专门的模块来实现高效的连续控制,例如动作专家或连续输出头,这些模块通常需要在预训练的VLM主干网络中增加新的未训练参数。虽然这些模块提升了实时性和控制能力,但它们是否保留或降低了预训练VLM中所包含的语义知识,以及它们对VLA训练动态有何影响,仍然是一个悬而未决的问题。在本文中,我们在包含连续扩散或流匹配动作专家的VLA背景下研究这个问题,发现简单地加入此类专家会显著损害训练速度和知识迁移。我们对各种设计选择、它们对性能和知识迁移的影响进行了广泛分析,并提出了一种在VLA训练期间隔离VLM主干网络的技术来缓解这个问题。视频可在 https://pi.website/research/knowledge_insulation获取。
1 引言
大型语言模型(LLM)的成功可归因于大规模数据集的可用性,以及强大的模型架构(如基于数万亿令牌进行下一个令牌预测目标训练的Transformer)。LLM可以通过提示来解决各种任务,从写诗、编写代码到解决竞赛级别的数学问题,并且当扩展多模态编码器以产生视觉-语言模型(VLM)时,还可以进一步适应解决视觉推理问题。将LLM的强大能力带入物理世界的下一个自然步骤,是进一步扩展它们以采取物理动作,从而产生视觉-语言-动作(VLA)模型,这些模型可以控制机器人遵循语言指令,将端到端机器人学习的能力与从网络规模视觉-语言预训练中提炼的语义知识相结合[59, 24, 7]。
然而,将LLM和VLM适应现实世界的控制需要解决许多新的挑战。大多数物理系统(例如机器人)需要连续且精确的指令,例如关节角度或目标位姿,并且必须以高频率实时生成。自回归解码离散令牌不太适合这种高频连续控制,这既是因为离散化动作的分辨率有限,也是因为大型模型自回归解码的计算成本高昂,而模型规模不断增大只会加剧这一挑战。
此外,物理系统通常会产生比VLM所训练的更为复杂的观测数据,例如多视角图像和本体感觉状态。这些差异使得有必要对原始VLM架构进行修改,以适应机器人控制。
因此,机器人学界已经开发出特别适合实时连续控制需求的架构[54, 11, 45, 55, 7, 32, 6, 8, 25, 22]。虽然许多不同的设计都取得了成功,但一个共同的主题是,为有效灵巧控制而调整的模型通常会用某种连续输入和输出的适配器来增强Transformer或VLM主干网络,其中后者最常使用例如带有动作块(未来动作的短序列)的扩散或流匹配[54]。这使得模型能够表示复杂的连续动作分布、选择非常精确的动作,并捕捉灵巧的高频技能。然而,当这些附加模块被添加到预训练的VLM中以创建VLA时,它们通常需要从头开始初始化,并且VLA训练过程必须将它们“嫁接”到VLM主干网络上。这就提出了一个重要问题:通过这些连续状态和动作适配器增强的VLA,实际上在多大程度上继承并受益于网络规模的预训练?
在这项工作中,我们观察到,先前用连续输出微调VLM的方法可能会导致显著变差的训练动态,这或许并不令人意外,因为它们依赖来自连续适配器(例如扩散头)的梯度作为训练信号。这可能会削弱它们解释语言命令的能力,并降低最终VLA策略的整体性能。为了应对这一挑战,我们提出了一种解决这些问题的训练方案,我们称之为知识绝缘。知识绝缘背后的关键思想是,用离散化动作微调VLM主干网络,同时调整动作专家以产生连续动作(例如通过流匹配或扩散),但不将其梯度回传到VLM主干网络中。我们在图1中对此进行了说明。实际上,离散动作令牌提供了一种替代学习信号,该信号不受动作专家未初始化权重的影响,因此VLM仍然能够学习适合机器人控制的表示,但不会受到来自动作专家的梯度所带来的干扰。这种方法还有额外优势:首先,使用下一个令牌预测使模型学习得更快、更稳定。其次,使用动作专家仍然能够实现快速推理。第三,我们的方案使我们能够在通用视觉-语言数据上共同训练模型,将VLA的优势重新带回我们的模型中。我们的实验评估基于π0模型架构[7],对连续动作VLA中的各种建模选择进行了广泛分析。我们在复杂的、长时程的机器人操作任务上进行了评估,包括移动双臂机器人,以及DROID和LIBERO等开源基准测试。
![]()
2 相关工作
多模态大语言模型。在这项工作中,我们研究如何将机器人动作作为一种新模态集成到预训练的VLM中。在文献中,一种常见的技术是将新的输入模态嵌入到离散或连续的(“软”)令牌中[31, 26, 9, 42]。继早期关于多模态交叉注意力的工作[2]之后,近期研究表明,对于多模态生成建模(例如交错的图像、文本和语音预测),将模态分离为特定于模态的“专家”网络并使它们相互交叉注意力,可以防止干扰并带来更高质量的预测[28, 40, 49]。虽然这些工作训练了视觉-语言-语音模型,但我们感兴趣的是使用类似的架构将一种新模态——机器人动作——融合到预训练的VLM中。
视觉-语言-动作模型(VLA)。视觉-语言-动作模型最近被提出作为一种有前景的泛化机器人控制方法[14, 59, 24, 7, 50, 56, 34, 27, 3, 41, 37, 43, 51, 6, 21]。VLA的核心思想是微调预训练的视觉-语言模型(VLM)以进行动作预测。此类VLA能够很好地扩展到大规模机器人数据集[12, 15, 48, 36, 23, 5, 17, 39, 1],并已被证明可以迁移来自网络规模VLM预训练的知识以提高策略泛化能力[59, 24]。为了实现对动作数据的VLM微调,VLA训练流程通常将连续动作映射为离散动作令牌的序列,这可以通过简单的分箱离散化[59, 24]或更先进的基于压缩的令牌化方法[37]来实现。然后通过标准的自回归下一个令牌预测来训练VLA。虽然这种策略在较简单的低频控制任务上有效,但它有两个缺点:(1)从连续动作到离散动作令牌的映射可能是有损的;(2)自回归解码动作导致策略推理速度较慢[37, 3]。因此,现代自回归VLA通常以低于2Hz的控制频率运行[37],使得它们对于许多高频任务不实用。
VLA中的快速连续动作解码机制。为解决这些问题,多项先前工作探索了VLA的替代动作解码机制,这些机制保留连续动作输出和快速推理。这些方法通常在VLA动作微调期间引入新的权重和损失,通常通过扩散预测头[34, 51, 32, 6]或基于流匹配的“动作专家”[7, 8]来实现,这些机制关注VLM主干网络中的特征。虽然这些方法能够实现快速推理,但在微调期间简单地添加新权重和训练损失会带来自身的问题:此类VLA的训练速度通常明显慢于自回归对应模型,并且遭受网络数据迁移减少的问题[37]。Liu等人[32]引入了一种混合自回归-扩散训练方法,但在推理时仍然需要缓慢的自回归动作解码。包括OpenVLA-OFT [25]和π0.5 [22]在内的几项工作采用了两阶段流程,其中模型首先使用自回归离散化进行训练,然后使用连续输出在目标领域进行微调。
π0和π0.5模型。我们以π0 [7]和π0-FAST [37] VLA为基础。π0引入了一个连续动作专家,它可以捕捉动作块上的复杂连续分布,实现高效推理,并能够连续控制灵巧任务,例如叠衣服。然而,正如我们在实验中所示,π0方案本身会导致语言遵循和训练速度方面的性能下降,因为来自动作专家的梯度会降低预训练的VLM主干网络。π0-FAST通过使用令牌化动作解决了这个问题,使用基于DCT的令牌化器,能够对复杂动作块进行高效离散化,但代价是需要昂贵的自回归推理,并降低了执行精细和动态任务的能力,我们在实验中也说明了这一点。π0.5 [22]首先仅使用FAST令牌化动作进行训练,然后在后训练中添加一个随机初始化的动作专家,以便在移动操作数据上进行微调(通过联合训练)。我们的工作将π0.5的方法形式化,并将其扩展为开发一种单阶段训练方案,其中VLM主干网络通过离散令牌适应机器人控制,同时动作专家被并行训练以产生连续动作,从而提供两全其美的效果。我们在实验中严格消融了知识保留和协同训练的不同机制。因此,我们提出了第一个训练快速、保留VLM知识并支持具有连续动作输出的高频控制的VLA方案。
3 标准视觉-语言-动作(VLA)模型训练方案
![]()
![]()
![]()
![]()
大多数VLA是在大型机器人行为克隆数据集上训练的。对于自回归架构,标准的训练流程是最小化目标令牌的负对数似然:
![]()
4 标准VLA方案存在的问题
在图2中,我们可视化了当前VLA训练方案存在的问题。
自回归VLA速度慢。自回归VLA将预测实值动作的问题转化为离散的下一个令牌预测问题,这既限制了模型所能表示值的分辨率,也导致了缓慢的序列化推理。π0-FAST预测一个1秒动作块的推理时间在RTX4090 GPU上约为750毫秒[37],正如我们在实验中所示,这可能导致动力学不匹配并拖慢整体轨迹。
机器人专用架构和模态适配器未能充分利用VLM预训练的优势。像π0 [7]或GROOT [6]这样的架构包含机器人专用模块以实现更快的推理。例如,π0架构中的动作专家参数少于VLM主干网络,因此π0可以实现10Hz的控制频率,远快于自回归VLA(1.3Hz)。虽然这些模型的部分组件(例如视觉编码器或语言模型主干网络)是从预训练的VLM初始化的,但机器人专用模块是从头初始化的。我们表明,用这样一个随机初始化的动作专家进行朴素训练会损害模型遵循语言命令的能力(推测是由于梯度干扰所致)。
![]()
VLM预训练不具备足够的机器人任务表征——冻结不起作用。直观上,维持VLM预训练知识、从而避免上述问题的最简单方法是冻结预训练权重,仅训练新添加的机器人专用权重。然而,当前的VLM并未使用机器人数据进行预训练。因此,它们的表征在被冻结时不足以训练出高性能的策略,正如我们在实验中所展示的,参见图4a和图8(0%性能)。
![]()
![]()
5 通过协同训练、联合训练与知识绝缘来改进VLA
我们考虑采取多项措施来克服先前VLA方法在第4节中概述的局限性。具体而言,我们提出:
同时对自回归和流匹配动作预测进行联合训练。该模型在测试时使用(较小的)动作专家生成连续动作以实现快速推理。自回归目标仅在训练时用作表征学习目标,这使得模型能够更快地训练。
在非动作数据集(例如通用视觉-语言数据和机器人规划数据)上对模型进行协同训练(VLM数据协同训练)。在这些数据源上进行训练可确保模型在适应VLA时损失更少的知识。
阻断动作专家与主干网络权重之间的梯度流。这样,在将预训练的VLM适应为VLA时,新初始化的动作专家权重不会干扰预训练权重。
![]()
![]()
![]()
5.2 知识绝缘与梯度流
![]()
![]()
6 实验
我们在现实世界中包含多种不同机器人本体(图3)的灵巧、长时程操作任务上评估我们的方法。这些任务包括清理餐桌(“table bussing”);使用静态双臂机器人折叠衬衫(称为“shirt-folding”);使用静态单臂机器人将家居物品放入抽屉(“items in drawer”);以及涉及双臂移动操作器的多个任务。对于后两者,我们仅在模型未曾见过任何数据的未见过场景中评估模型。我们还在LIBERO仿真基准[30]以及现实世界的DROID [23]上展示了结果。我们既在单一机器人本体上训练模型,也在来自许多不同机器人的大量任务的大规模混合数据上训练通用模型,包括非动作预测任务,如图像描述、边界框预测和机器人规划。任务、数据集和模型训练的详细信息请参见第A、B节。我们的实验评估聚焦于以下问题:
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
从VLM数据到机器人的知识迁移。VLA的主要动机之一是将非机器人数据源的知识迁移到机器人策略中。我们使用移动操作机器人进行了一项实验,研究对新物体的语义泛化能力。机器人的任务是将物体从厨房台面移入一个(已打开的)抽屉。训练期间未见这些物体。如图7中“OOD Follow Rate”所示,VLM数据协同训练对于这种泛化尤为重要。
其他建模选择的探究。我们的主要方案使用FAST [37] 将离散动作表示为模型主干网络的表征学习目标。FAST的动机之一是相对于朴素令牌化,它能提供更好的学习信号,并有助于更快的推理(由于令牌更少)。由于我们仅在训练期间使用离散动作令牌,人们可能会疑问更简单的朴素令牌化是否足以学习良好表征。为了探究这一点,我们在训练期间将FAST替换为朴素令牌化,但保持其他所有选择不变。所得模型仍然优于仅使用连续动作训练的模型,但差于使用FAST进行表征学习的模型(图5)(参见图中朴素令牌)。在这种情况下,子采样令牌(通过步长5)优于密集朴素令牌化。在附录(图10)中,我们在清理餐桌任务上比较了机器人本体感觉状态的不同选择,参见第C节,发现我们的方法在文本状态和连续状态下均有效。
![]()
7 讨论与局限性
我们分析了将VLM微调为输出连续动作的连续动作VLA的性能、泛化能力和语言遵循能力,表明此类模型会遭受预训练知识显著损失的问题,并提出了一种通过在VLA训练期间屏蔽预训练VLM主干网络来大幅缓解这种性能下降的方法。我们方法的核心思想是使用离散化动作为微调VLM表征提供学习信号,同时训练连续(流匹配)动作专家但不将其梯度传播到VLM中。因此,VLM主干网络不会受到来自动作专家的反向传播的损害,但仍然接收(来自离散动作的)学习信号,使其表征适应机器人控制任务。在众多现实世界和模拟任务上的实验为我们的假设——即朴素训练会导致VLM主干网络性能下降——提供了强有力的证据,并明确表明我们的方法能够缓解这一挑战。
我们的方法为训练连续动作VLA提供了一种有效的方案,但也存在局限性。在训练期间同时使用连续和离散输出会使计算成本增加约20%。然而,由于收敛速度的提高,这一成本被抵消,使得我们的模型相对于纯扩散基VLA(如π0)在训练时间(按挂钟时间计算)上仍然快得多。此外,虽然我们的方法改善了语言遵循能力,但仍远非完美,这可能是因为训练数据中的相关性仍然导致模型有时会忽略语言指令。
原文链接:https://www.pi.website/download/pi05_KI.pdf
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.