论文

Q-VGM:用于流量匹配 VLA 策略的离线到在线 RL 的 Q 引导值梯度匹配

Q-VGM: Q-Guided Value-Gradient Matching for Offline-to-Online RL of Flow-Matching VLA Policies

模型训练强化学习

摘要

我们提出了 Q 引导价值梯度匹配(Q-VGM),这是一种离线到在线的 RL 方法,用于 微调 流匹配视觉-语言-动作策略与学习批评家。直接将批评梯度应用于流量策略需要通过多步去噪过程(BPTT)进行反向传播,这在 VLA 规模上成本高昂且不稳定。在去噪的最优控制视图的推动下,我们得出了一种局部近似,将清洁动作值梯度与后期去噪步骤的局部速度校正联系起来。 Q-VGM 使用此连接通过速度匹配为预训练动作专家 微调 构建评论家引导的目标。梯度仅通过局部速度预测,避免通过去噪轨迹反向传播。动作敏感的块批评家接受离线 IQL 和在线 TD 学习的训练。在 LIBERO 上,Q-VGM 使用每套件 150 个策略执行轨迹,将少样本 SFT 四套件的平均离线率从 84.6% 提高到 90.7%,在线训练后达到 98.4%。与 同策略 RL 相比,Q-VGM 在四个 LIBERO 套件中的平均样本效率提高了 5.3 倍,以 95% 的执行轨迹成功率的剧集预算来衡量。在三项现实世界的双手任务中,离线 Q-VGM 将平均成功率从 66.7% 提高到 98.3%。