论文
ProcVLM:基于学习过程的机器人操作进度奖励
ProcVLM: Learning Procedure-Grounded Progress Rewards for Robotic Manipulation
摘要
长视野机器人操作需要密集的反馈,反映任务在其程序阶段的进展情况,而不仅仅是最终结果是否成功。现有的奖励模型通常依赖于轨迹级成功标签或基于时间的插值,这可能会将经过的时间与真实的任务进度混为一谈,因此无法捕获未完成的步骤、停滞和失败状态。我们提出了 ProcVLM,一种进度感知的视觉语言模型,它学习基于程序的进度作为操作的密集奖励信号。 ProcVLM 不是从最终结果或时间代理中得出进度,而是将进度估计建立在程序结构和阶段内视觉变化的基础上,并进一步采用估计前推理范式,在估计任务进度之前推断剩余的原子操作。具体来说,我们通过综合帧级子任务语义注释、根据子任务结构分配进度预算以及根据子任务内视觉变化分配每个预算来构建这种监督。为了大规模训练 ProcVLM,我们构建了一个标准化的程序监督合成管道,并从 30 个具有 60M 带注释帧的具体数据集构建了 ProcCorpus-60M,从中我们推导出用于程序感知预训练的 ProcVQA,以进度估计为中心任务,同时还有动作分割和未来规划。 ProcVQA 和奖励模型基准的实验表明,ProcVLM 改进了具体的程序推理,并产生比代表性基线更具辨别力的轨迹内部进度估计,支持其用作下游奖励引导策略优化的密集奖励模型。项目页面:https://procvlm.github.io/