论文
强化学习机器人代理的视觉-语言-动作快速启动
Vision-Language-Action Jump-Starting for Reinforcement Learning Robotic Agents
摘要
强化学习 (RL) 可以实现机器人操作的高频闭环控制,但由于探索效率低下和贡献分配不佳,扩展到奖励稀疏或不完善的长期任务仍然很困难。视觉-语言-动作(VLA)模型利用大规模多模态预训练来提供通用的任务级推理,但当前的限制阻碍了它们在快速和精确的操作中的直接使用。在本文中,我们提出了视觉-语言-动作跳跃启动(VLAJS),这是一种将稀疏 VLA 指导与 同策略 RL 连接起来的方法,以提高探索和学习效率。 VLAJS 将 VLA 视为高级行动建议的短暂来源,这些建议会偏向早期探索并改善贡献分配,同时保留对 RL 的高频、基于状态的控制。我们的方法通过定向动作一致性正则化增强了近端策略优化(PPO),该正则化可以在早期训练期间将 RL 代理的动作与 VLA 指导柔和地对齐,而无需强制严格模仿,不需要演示或依赖持续的教师查询。 VLA 指导被稀疏地应用并随着时间的推移而退火,允许代理在线适应并最终超越指导策略。我们在六种具有挑战性的操作任务上评估 VLAJS:模拟中的提升、拾放、钉重新定向、钉插入、戳和推动,并在真实的 Franka Panda 机器人上验证子集。 VLAJS 在样本效率方面始终优于 PPO 和 蒸馏 式基线,在多项任务中将所需的环境交互减少了 50% 以上。现实世界的实验证明了零样本模拟到真实的传输以及在杂乱、对象变化和外部扰动下的稳健执行。