实时视觉-语言-动作策略的强化学习
Reinforcement Learning for Real-Time Vision-Language-Action Policies
摘要
在大型预训练视觉语言动作 (VLA) 模型之上进行强化学习微调,为高度可靠的机器人部署提供了希望。然而,由于其规模,现代 VLA 模型存在高推理延迟,因此用于选择操作的观察结果通常在执行时间上已经过时,从而产生分布变化,从而大大降低可靠性和性能。先前的工作已经探索了异步策略执行以减少延迟的影响,但这些方法大多建立在模仿学习的基础上,并且没有提供超越训练分布以获得更高可靠性的机制。我们通过启用 RL 微调来缩小这一差距,以满足动态现实世界操纵的实时控制要求。我们的方法建立在 EXPO-FT 的基础上,EXPO-FT 是一个通过强化学习进行样本高效、可靠的 VLA 微调的框架,并将缓慢、富有表现力的动作生成与快速、反应性动作编辑解耦:大型预训练 VLA 使用其强大的先验行为提出动作块,而轻量级编辑策略通过根据最新观察结果编辑动作以响应状态变化来执行快速、反应性决策。我们将其实例化为 Real-Time EXPO-FT,这是一个用于微调实时 VLA 策略的 RL 框架。在 Kinetix 基准测试中,Real-Time EXPO-FT 使延迟策略能够在 10 个环境中的 10 个环境中实现延迟和非延迟方法中的最佳性能。在机器人物体传球、球平衡、桌上足球踢和动态物体拾取这四项动态现实任务中,在线机器人数据上限为 10 分钟,实时 EXPO-FT 将平均策略性能从 42% 提高到 97%,所有这些都无需人工干预,展示了对具有挑战性的现实世界动态的快速、样本高效的适应。网站:https://pd-perry.github.io/real-time-expo-ft