论文

VLaRL:用仿真训练残差控制修正冻结 VLA

VLaRL: Augmenting Vision-Language-Action Models with Simulation-Trained Latent-Conditioned Residual RL

模型训练应用与实践强化学习机器人

摘要

视觉-语言-动作(VLA)模型提供了广泛的、指令条件下的操纵行为,但它们的物理执行在接触丰富的交互过程中可能仍然不精确。残差强化学习 (RL) 可以纠正此类错误,同时保持 VLA 冻结,但真正的机器人 RL 成本高昂且安全性至关重要。我们提出了 VLA 潜条件强化学习 (VLaRL),它使得冻结 VLA 的残差强化学习能够在模拟中进行训练,并部署在真实机器人上,而无需现实世界的强化学习或在线适应。尽管模拟与现实之间存在视觉差距,但关键的挑战是迁移学习到的残差策略。 VLaRL 不需要像素级视觉对应,而是使用 VLA 的内部视觉语言潜在表示来调节残差控制并作为模拟到真实的传输接口,并学习一个轻量级映射器,将模拟导出的潜在特征转换为真实的潜在分布。在四个接触丰富的操纵任务和两个 VLA 主干中,VLaRL 提高了所有任务主干组合的现实世界成功率,而受控消融则证明了潜在调节和潜在对齐对于传输模拟训练的残差控制的重要性。

VLaRL依次微调VLA、训练潜在映射、仿真训练残差策略并部署到真实机器人。
图2(图注摘要):VLaRL依次微调VLA、训练潜在映射、仿真训练残差策略并部署到真实机器人。