论文

Robo-Dopamine 2.0:机器人操作的历史条件和 OOD 感知过程奖励建模

Robo-Dopamine 2.0: History-Conditioned and OOD-Aware Process Reward Modeling for Robotic Manipulation

模型训练奖励建模与过程监督

摘要

视觉-语言-动作 (VLA) 模型改进了机器人操作,但仍然容易受到复合错误、场景变化和偏离轨迹状态的影响。强化学习可以完善预训练的 VLA 策略,但稀疏的成功信号会阻碍探索,而设计密集的奖励成本高昂且针对特定任务。现有的学习视觉奖励模型通常依赖于静态的前后观察,导致时间模糊,并且在分布外(OOD)执行下保持鲁棒性的变化和任务无效失败之间的区分能力较弱。我们引入了 Robo-Dopamine 2.0,这是一种具有成对预测接口的历史和 OOD 感知过程奖励模型。它结合了 (1) 历史条件成对奖励,使用源对齐的参考面板进行合成 OOD 查询,并观察在线查询的执行轨迹历史,同时保留查询的端点;(2) 一个 OOD 感知的签名进度空间,表示有效的进度、稳健性、失败和恢复。具有转换感知重放功能的签名跳课程可以在细粒度进度校准之前学习粗略的执行顺序。我们还构建了 OOD 轨迹数据集和五家庭基准。参考面板将平均视觉顺序一致性 (VOC) 从 0.967 提高到 0.986,将 OOD 鲁棒性 VOC 从 0.906 提高到 0.958。在相同的 400K 成对奖励预算下,具有 25% 重放的 Signed-Hop 训练的平均 VOC 达到 0.9872,而匹配池洗牌控制的平均 VOC 为 0.9858。在下游强化学习中,完整模型实现了 86.8% 的 RoboTwin 平均成功率和 71/80 的现实世界插入成功率。