来源:市场资讯
(来源:机器学习算法那些事)
OPEN SOURCE · EMBODIED AI
清华韩军功教授团队开源 PhaseLoRA
让机器人 LoRA 随操作阶段动态适配
让 VLA 以轻量方式适配不同机器人任务,并进一步感知轨迹内部不断变化的控制状态
论文与代码现已公开 | PhaseLoRA
随着 π₀、π₀.₅、OpenVLA 等视觉-语言-动作模型(Vision-Language-Action,VLA)不断发展,一个越来越现实的问题正在出现:预训练 VLA 很强,但真正落到机器人上,还要面对大量下游适配。
机器人型号会变、相机视角会变、末端执行器会变、桌面环境会变,任务本身也会不断增加。对 VLA 来说,“训练出一个基础模型”并不是终点,如何低成本地把同一个基础模型适配到不同机器人和不同操作任务,本身就是走向实际部署的关键环节。
WHY LORA MATTERS FOR VLA
在 VLA 中,LoRA 不只是一个“省显存的训练技巧”。
它更像是连接“通用基础策略”与“具体机器人任务”的轻量适配接口。
一、LoRA 在 VLA 下游适配中的作用
VLA 的参数规模越来越大,而机器人下游适配又不是一次性的。一个基础策略未来可能需要服务于多个机器人平台、多个任务族和多个部署环境。如果每增加一个场景,都重新全量更新并保存一整套模型,那么训练、显存、存储和维护成本都会随任务数量一起增长。
这正是参数高效微调(PEFT)在 VLA 中具有特殊意义的原因。LoRA 冻结绝大多数预训练参数,只学习少量低秩更新,使我们可以把部署方式从“一个任务对应一整套模型”,转变为更模块化的“一个共享 VLA Backbone + 多个轻量 Adapter”。
ONE BACKBONE · MANY ADAPTERS
SHARED
Pretrained
VLA Backbone
Adapter A · 新机器人平台
Adapter B · 新操作任务
Adapter C · 新工作环境
…… 持续扩展,而无需为每个场景复制整个基础模型
这对机器人研究尤其重要。机器人系统天然需要反复经历“采集数据 → 微调 → 上机测试 → 发现失败 → 补数据 → 再微调”的闭环。相比一次性追求最高性能,能否让每一次下游适配更轻、更快、更容易复用,直接决定了 VLA 的实验迭代和规模化部署成本。
这里并不是说 LoRA 要取代全量微调。 在算力和存储预算充足、目标是追求最高绝对成功率时,全量微调仍然具有更高的性能上限。LoRA-VLA 研究关注的是另一个同样重要的问题: 在远小于全量微调的适配预算下,能把 VLA 的下游能力推到多高?
在我们的实现中,PhaseLoRA 只训练约 4.41% 的参数;LIBERO 单个 suite 的 30,000 steps 训练可在单张 RTX 5090 上完成,峰值显存约 22.1 GiB,训练时间约 24 GPU-hours。这类轻量适配方式,为 VLA 在更多机器人任务上的快速迭代提供了现实基础。
因此,为什么改进 LoRA-VLA 值得研究?
因为如果 LoRA 正在成为 VLA 面向大量下游任务的一种重要适配方式,那么LoRA 本身能否更懂机器人控制,就会直接影响这种轻量适配范式的性能上限。
二、标准 LoRA 为什么还不够?
标准 LoRA 很适合回答“如何用少量参数适配一个新任务”,但它隐含了一个对机器人控制并不理想的假设:一旦 LoRA 训练完成,在整条执行轨迹中,它使用的始终是同一个低秩更新。
而机器人完成一次操作,并不是一个始终不变的控制过程。从接近目标、发生接触、抓取物体,到搬运、释放和精准放置,不同阶段对策略修正的需求明显不同。
标准 LoRA 在连续控制中的局限
01静态更新 — 整条操作轨迹始终采用同一个低秩更新方向;
02阶段不敏感 — 无法主动区分接近、抓取、搬运和放置等控制状态;
03增大 Rank 不等于解决问题 — 参数容量变大,并不意味着能够建模轨迹内部不断变化的控制需求;
04人工阶段划分成本高 — 显式标注 grasp / transport / place 等阶段,往往需要额外人工或传感信息。
FIGURE 01 · 论文 Figure 1
![]()
一条机器人操作轨迹会经历 Approach、Grasp、Transport、Place 等不同控制状态;PhaseLoRA 用 fine-control tendency P 与 event/boundary intensity E 描述这种轨迹内变化。
也就是说,LoRA-VLA 面临的真正矛盾是:我们希望 Adapter 足够轻量,但又希望它能够随着机器人当前控制状态发生变化。
三、PhaseLoRA:让 LoRA 随控制状态变化
PhaseLoRA 的核心思想并不复杂:在每一次 action-chunk 预测时,根据当前控制状态,对 LoRA 的有效更新方向进行调整。
为了描述机器人当前处于怎样的控制状态,我们设计了两个连续的弱监督描述量。
CONTROL SIGNAL 01
Fine-control tendency
刻画当前时刻对精细控制的需求。越接近目标、抓取或放置阶段,对动作精度的要求通常越高。
CONTROL SIGNAL 02
Event / boundary intensity
刻画接触、抓取、释放等控制变化的强度,用来捕捉轨迹中关键事件附近的状态转折。
这两个信号通过动作幅度、动作变化和夹爪状态等轨迹统计自动构造弱监督信息,因此不需要人工为每条轨迹划分 Approach / Grasp / Place 等阶段,也不依赖额外的力觉或触觉传感器。
PHASELORA 的三个特点
无需阶段标注:直接利用已有机器人示范轨迹构造弱监督信号。
保持低秩结构:每一步更新依然是低秩的,不牺牲 LoRA 的参数效率。
聚焦 Action Expert:条件适配主要作用于 VLA 的动作专家,预训练骨干网络基本冻结。
FIGURE 02 · 论文 Figure 2
![]()
PhaseLoRA 方法总览:轻量 router 从当前策略上下文预测 P̂ 与 Ê,并据此调节 Action Expert 中的 LoRA 左因子;弱监督信号由轨迹统计自动构造,无需人工阶段标签。
四、不是“选择不同 LoRA”,而是改变 LoRA 的方向
PhaseLoRA 并不是简单地堆叠多个完整 LoRA expert,再在不同阶段之间进行硬切换。
相反,我们根据两个连续控制描述量调节 LoRA 的左因子,使有效低秩更新方向能够随着控制状态连续变化,同时保证每一个时刻的更新仍然保持低秩结构。
传统问题
LoRA 应该加在哪?Rank 应该多大?
PhaseLoRA 进一步追问
LoRA 是否还应该考虑“机器人此刻正在做什么”?
我们将这一思路概括为:Within-Trajectory Conditioning,即把“轨迹内部控制状态”作为一个新的参数高效适配维度。
五、LIBERO:平均成功率 68.9%
基于 π₀.₅,我们在 LIBERO-Spatial、LIBERO-Object、LIBERO-Goal 和 LIBERO-10 四个标准任务套件上进行了系统评测。
AVERAGE SUCCESS RATE
68.9%
四个 LIBERO 套件平均
VS. MATCHED HIGH-RANK LORA
百分点提升
TRAINABLE PARAMETERS
4.41%
COMPARISON
超过 DoRA / LoRA-MoE / LoRA-SP
TABLE 01 · LIBERO 主结果
![]()
论文 Table 1:PhaseLoRA 在四个标准 LIBERO 套件上的平均成功率为 68.9%,可训练参数占比 4.41%。
这组结果传递了一个很直接的信息:让 LoRA“什么时候怎么变”,可能比单纯让 LoRA“变得更大”更加重要。
六、提升真的来自“阶段感知”吗?
一个自然的问题是:PhaseLoRA 的提升,会不会只是因为模型增加了一些额外参数?
✕随机加入时序变化 — 无法复现完整 PhaseLoRA 的效果。
✕只做标量缩放 — 固定更新方向、只改变更新强度,同样不足。
✓控制状态相关的方向变化 — 才能获得完整方法的性能提升。
因此,PhaseLoRA 的收益并不只是“多了几个参数”,更重要的是模型获得了与机器人控制状态相对应的动态适配能力。
TABLE 03 · 消融实验
![]()
论文 Table 3:随机 descriptor、scalar-gated update、去除弱监督以及只使用单一 descriptor 都不能达到完整 PhaseLoRA 的效果。
七、真实机器人:平均成功率 69.2%
除了 LIBERO 仿真环境,我们还进一步在 Piper 机械臂上进行了四类桌面操作实验:将网球从黄色托盘移动到蓝色托盘、从蓝色托盘移出长方体、将红色方块放入黄色托盘,以及将苹果放到黄色托盘。
在每项任务、每种方法共 30 次物理试验的设置下,PhaseLoRA 的平均成功率达到 69.2%,相比参数量匹配的 High-rank LoRA 提升 18.4 个百分点。
REAL-ROBOT SUCCESS RATE
69.2%
Piper manipulator
VS. HIGH-RANK LORA
百分点提升
TABLE 02 · 真实机器人主结果
![]()
论文 Table 2:PhaseLoRA 在 Move、Remove、Pick、Put 四个真实机器人任务上取得 69.2% 的平均成功率。
FIGURE 04 · 真实机器人实验平台
![]()
论文 Figure 4:Piper 机械臂、完整桌面实验环境以及外部相机视角。真实机器人策略使用腕部与外部两个 RGB 视角进行闭环执行。
八、LoRA 到底在什么时候发生变化?
除了最终成功率,我们还进一步分析了 PhaseLoRA 在整条轨迹中的更新方向变化。
结果显示,显著的更新方向变化并不是均匀或随机出现的,而是更多集中在抓取、搬运转换和放置等关键操作事件附近。
一个有意思的观察
当机器人控制模式发生明显变化时,PhaseLoRA 学到的参数适配也会同步发生变化。
从某种程度上说,模型自己学会了:什么时候需要“换一种控制方式”。
FIGURE 05 · 论文 Figure 3
![]()
PhaseLoRA 在 LIBERO-Spatial 上的更新方向变化。显著峰值较为稀疏,并倾向于出现在 grasp、transport transition 与 placement 等关键操作事件附近。
九、PhaseLoRA 已开源
PhaseLoRA 基于 OpenPI 构建。目前论文与代码均已公开,并提供从训练、评测到闭环策略服务的完整流程。
OPEN-SOURCE CONTENT
01 π₀ / π₀.₅ 的 PyTorch 微调与策略服务
02 PhaseLoRA、标准 LoRA、全参数微调等实验配置
03 单卡与分布式训练、断点续训、Safetensors 检查点
04 LIBERO 训练与评测流程,支持结果记录和视频保存
05 ALOHA 仿真评测流程
06 基于 WebSocket 的闭环策略推理接口
07 代码测试与可复现实验说明
OPEN SOURCE · GITHUB
GRINFFIN / PHASELORA
PhaseLoRA
PyTorch Training · LIBERO / ALOHA Evaluation · WebSocket Policy Serving
github.com/Grinffin/PhaseLoRA
仓库已公开训练、评测与策略服务流程,可直接用于复现与后续扩展。
十、我们想探索的,是 LoRA 的一个新维度
过去讨论机器人模型的参数高效微调时,我们通常关注:LoRA 应该加在哪一层?Rank 应该设多大?应该训练 VLM,还是 Action Expert?
当 LoRA 被视为 VLA 面向大量下游机器人任务的重要适配接口之后,PhaseLoRA 想进一步提出另一个问题:
OUR QUESTION
LoRA 是否还应该考虑
“机器人此刻正在做什么?”
对于连续动作 VLA 而言,模型面对的并不是一组彼此独立的静态样本,而是一条不断变化的控制轨迹。因此,参数适配也未必应该在整条轨迹中保持完全静态。
PhaseLoRA 所探索的,就是这样一个新的方向:不仅让 LoRA-VLA 更轻量,也让它真正感知轨迹内部的控制状态。如果未来一个 VLA Backbone 需要快速适配大量机器人和任务,那么提升这种轻量适配机制本身的能力,就具有直接的研究与应用价值。
在基本不改变预训练骨干、保持低秩参数结构的前提下,使 VLA 策略能够以更轻量的方式,适应机器人操作过程中不断变化的控制需求。
PAPER & CODE
论文
PhaseLoRA: Control-Regime-Conditioned Low-Rank Adaptation for Continuous-Action Vision-Language-Action Policies
https://arxiv.org/abs/2608.15285
代码
GitHub · Grinffin/PhaseLoRA
https://github.com/Grinffin/PhaseLoRA
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.