论文

ARM:长期操纵的优势奖励模型

ARM: Advantage Reward Modeling for Long-Horizon Manipulation

模型训练奖励建模与过程监督

摘要

长期机器人操作对于强化学习(RL)来说仍然具有挑战性,因为稀疏的奖励为学分分配提供的指导有限。因此,实际的政策改进依赖于更丰富的中间监督,例如密集的进步奖励,但获得这些监督的成本高昂,并且不适合回溯和恢复等非单调行为。为了解决这个问题,我们提出了优势奖励模型(ARM),这是一个从难以量化的绝对进展转变为估计相对优势的框架。我们引入了一种经济有效的三态标记策略——渐进式、回归式和停滞式——它可以减少人类认知开销,同时确保高度的跨注释者一致性。通过对这些直观信号进行训练,ARM 可以为完整的演示和分散的 DAgger 式数据实现自动进度注释。将 ARM 集成到离线 RL 管道中可以实现自适应动作奖励重新加权,从而有效过滤次优样本。我们的方法在具有挑战性的长视野毛巾折叠任务中实现了 99.4% 的成功率,证明了与当前 VLA 基线相比,稳定性和数据效率得到了提高,并且在政策训练期间几乎为零的人为干预。