论文

回顾过去并继续前进:生成机器人策略的时间验证

Looking Back to Move Forward: Temporal Verification for Generative Robot Policies

模型推理推理验证与自校正

摘要

生成策略已成为机器人学习的一种有前途的范例,它将表达性生成动作模型与来自大型示范语料库的可扩展模仿学习相结合。然而,异构演示可能会导致次优动作块,其错误会随着时间的推移而复合,最终导致机器人进入难以恢复的分布状态。操作验证提供了一种测试时计算扩展策略,通过对多个候选操作进行采样并使用验证器选择一个执行来减轻这种故障模式。然而,现有的方法在时间上仍然是短视的,并且训练成本高昂,仅根据当前观察来评估候选者,而不考虑轨迹连续性,并且通常依赖于大型验证者和额外的专家演示。在本文中,我们介绍了时间验证(TeV),这是一种用于流匹配 VLA 的高效时间感知动作验证框架。 TeV 首先学习一个时间标记,该标记总结了最近的观察行为历史,使候选块能够被评估为执行轨迹的延续,而不是孤立的预测。以此标记为条件,TeV 无需额外的专家演示或偏好注释即可构建正负对,并对比训练基于能量的验证器,将较低的能量分配给更高质量、轨迹一致的动作块。除了事后排名之外,TeV 还进一步利用学习到的能量景观来引导中间流样本流向较低能量区域,从而在最终选择之前改进候选者。模拟和现实环境中的大量实验表明,TeV 可以可靠地对候选动作进行排名,提高任务成功率,并产生更平滑的执行轨迹。