论文

机器人操作的世界价值模型

World Value Models for Robotic Manipulation

模型训练奖励建模与过程监督

摘要

通才价值模型在从大规模、混合质量的数据中扩展机器人策略学习方面发挥着关键作用。从数学上讲,准确的价值估计需要深入的时间理解,需要模型既利用历史背景来建立当前的信念,又对未来的结果进行规划。然而,大多数现有的机器人价值模型都是建立在视觉语言模型(VLM)主干上的,这些主干主要是根据静态或时间稀疏视觉观察进行预训练的,缺乏价值估计所需的时间建模功能。与 VLM 不同,世界模型自然擅长时间建模和未来规划,这使它们成为学习可推广价值函数的理想基础。在这种洞察力的驱动下,我们将世界模型与价值估计相结合,构建了一个新的通用机器人价值模型,即世界价值模型(WVM),它提供准确的任务进展来评估数据质量。在标准基准上,WVM 提供最先进的 (SOTA) 值顺序相关性 (VOC) 结果。为了补充仅包含专家数据的标准评估套件,我们进一步引入了 Suboptimal-Value-Bench,这是一个多实施基准,由 800 个次优轨迹组成,具有高保真、人工标记的帧注释。我们的评估表明,WVM 在次优值基准上保持了 SOTA 性能,确立了其在处理专家数据和次优数据方面的稳健性。当部署用于策略学习时,WVM 可以提高模拟和实际部署中各种策略提取方法的操作性能,为从混合质量数据中学习提供强大的指导。