论文
SARM2:用于自我改进机器人操作的多任务阶段感知奖励建模
SARM2: Multi-Task Stage Aware Reward Modeling for Self Improving Robotic Manipulation
摘要
微调 用于长视野操纵的视觉-语言-动作(VLA)策略仍然严重依赖行为克隆,这需要昂贵的高质量演示并使策略保持在演示分布附近。奖励模型可以通过重新加权演示并为机器人强化学习(RL)提供密集监督来减少这种依赖性,但它们必须是密集、准确和通用的。现有方法存在不足:特定于任务的阶段感知模型是准确的,但需要每个任务的注释,而通用视觉语言模型(VLM)奖励模型广泛适用,但对于细粒度的长期进展来说过于粗糙。我们引入 RM,一种多任务阶段感知奖励模型,它将基于动作原语的阶段估计器与多门专家混合 (MMoE) 值头相结合,在操作任务中产生密集的每步奖励。在 RM 的基础上,我们进一步提出 SPIRAL(通过奖励调整学习进行自我策略改进),这是一种 同策略 奖励引导框架,可以通过低成本自主采样轨迹来改进 VLA 策略。在 10 项任务基准上,RM 使价值估计 MSE 比最强基准降低了 80%;当在 SPIRAL 中使用时,它在折叠短裤(58% 到 100%)和清洁白板(50% 到 90%)上的任务成功率从大约 50% 提高到近乎完美,这表明高质量的密集奖励是稳定的机器人数据飞轮的关键。项目网站:https://qianzhong-chen.github.io/sarm2.github.io/。