论文

通过视觉语言模型指导自动化基于潜力的奖励塑造

Automating Potential-based Reward Shaping with Vision Language Model Guidance

模型训练奖励建模与过程监督

摘要

稀疏奖励对于强化学习代理来说本质上是一个挑战,因为它们缺乏中间反馈来指导探索并将稀疏成功奖励正确地归因于轨迹的相关部分。朴素的奖励塑造可能会引发 奖励作弊,从而产生利用辅助信号而不是解决预期任务的策略。基于势的奖励塑造(PBRS)保证了最优策略集的保存,但需要在状态空间上定义启发式势函数。在这项工作中,我们介绍了 VLM 引导的 PBRS 框架 VLM-PBRS,它直接从视觉语言模型 (VLM) 反馈中学习势函数。我们查询轻量级 VLM 以获得对图像对的偏好,并使用这些偏好训练势函数的模型。由于这种方法基于基于潜力的奖励塑造,因此它保留了原始的最优策略,并且消除了对专家设计的奖励塑造条款的需要。由于在策略学习期间重复调用大型 VLM 的成本过高,因此我们采用更小、计算效率更高的 VLM。尽管所得的偏好标签不太准确,但经验证据表明偏好标签仍然可以用来加速学习。我们在 Meta-World 和 Franka Kitchen 环境中凭经验验证了我们的方法,并强调了 VLM 偏好标签准确性和样本效率改进之间的联系。我们的贡献有三个方面:(1) 首次应用基于 VLM 偏好的学习来合成 PBRS 的潜在函数,(2) 利用小型 VLM 的有原则的低成本解决方案,以及 (3) 提高样本效率和 奖励作弊 鲁棒性的广泛实证证明。