论文
利用离线监督在大规模视觉-语言-动作模型中实现高效且可推广的强化学习
Leveraging Offline Supervision for Efficient and Generalizable Reinforcement Learning in Large-Scale Vision-Language-Action Models
摘要
人们普遍认为,在线强化学习 (RL) 在广泛的性能指标中比离线方法产生更好的策略。特别是,经过 RL 训练的策略表现出更强的分布外 (OOD) 行为,仅使用模仿学习方法训练的模型常常会遇到困难。最近的一项研究引入了以 OOD 为中心的基准,并报告称,与使用有监督的 微调 (SFT) 训练的策略相比,经过 RL 训练的视觉语言动作 (VLA) 策略实现了明显更好的 OOD 性能和略好的分布内 (IND) 性能。在这项工作中,我们研究混合离线在线训练是否可以结合两种方法的优点。具体来说,我们研究通过离线数据或离线训练的参考策略进行离线监督规范化的强化学习方法。我们在 OOD 基准上评估这些方法,并将它们与仅离线训练和标准强化学习进行比较。我们的结果表明,虽然离线训练本身实现的 OOD 性能有限,但将离线监督纳入强化学习中可以保留强大的 OOD 能力,同时大幅提高训练效率。特别是,引导方法达到了接近标准强化学习的性能,同时只需要大约一半的训练预算。混合方法不是在速度和 OOD 性能之间进行权衡,而是保留强大的 OOD 功能,同时实现这种效率增益。项目页面:https://alstar8.github.io/offline-supervision-vla-rl