论文

从演示到奖励:VLM 奖励模型的测试时提示优化

From Demonstrations to Rewards: Test-Time Prompt Optimization for VLM Reward Models

上下文与知识上下文工程

摘要

强化学习依赖于准确的奖励函数,而这些函数通常是手工设计的,甚至在机器人等实际应用中是不可用的。最近的工作探索了预训练视觉语言模型(VLM)作为奖励模型的零样本推理能力。然而,如果没有仔细的即时工程,这些方法往往会产生次优的回报,其中误报的预测会严重降低下游政策学习的效果。在机器人技术中,通常会收集包含专家演示的有限数据集来引导政策学习。这种情况提供了在政策训练之前优化奖励模型的机会。我们提出了 Demo2Reward 一种测试时适应技术,用于基于一些演示(3-10 个轨迹)来优化奖励模型的语言指令,以减少误报,同时保留真阳性。至关重要的是,这在策略学习期间不需要额外的 模型训练 或计算资源。我们表明,在一系列模拟机器人任务和策略骨干中,Demo2Reward 始终优于现有的零次和少次 VLM 奖励模型。最后,我们证明 Demo2Reward 可以有效地转移到现实世界的机器人学习场景,无需手动设计奖励函数即可实现策略学习。