论文

关注细微进展的机器人评估器

Robot Critics that Sweat the Small Stuff

模型训练奖励建模与过程监督

摘要

大型视觉语言模型包含有关世界和对象交互的多个先验知识,使它们在推理过程中成为有用的评估器,以引导机器人策略走向成功。然而,闭环机器人操作需要判断成功和失败之间的微小视觉差异,这对于当前的 VLM 来说仍然是一个挑战。我们引入了一种通过使用从策略中获得的成功和失败执行轨迹构建成对进度监督来微调评估器的方法。我们经过微调的评估器擅长细粒度的进度推理和微妙的故障检测,优于先前的进度推理基线。此外,我们使用动作条件视频模型来预测从策略中采样的多个候选动作的视觉效果,并表明我们的评估器可以正确识别要执行的成功候选动作,从而将现实世界任务中的平均策略成功率提高了 11%,将模拟任务中的平均策略成功率提高了 5.9%。