论文
世界行动模型的未来锚定验证和在线恢复
Future Anchored Verification and Online Recovery for World Action Models
摘要
世界行动模型(WAM)已成为机器人操纵的一个有前途的范例。他们首先预测任务应该如何执行,然后解码未来的行动。然而,一旦执行偏离预测,其余操作就无效。简单地从已经偏离分布的状态重新规划很少能恢复任务仍然需要的内容;现有的执行监视器决定何时停止,但不决定恢复什么。我们观察到答案已经在手:WAM 在采取行动之前预测的未来准确地描述了它想要经历的状态。我们引入了 FAVOR(Future Anchored Verification and Online Recovery),这是一个轻量级框架,它将这些预测帧保留为锚点并将其用于验证和恢复。锚验证器将每个观察值与其锚以及执行的操作进行比较,以标记破坏任务的偏差。锚引导恢复使用视觉语言模型将标记的锚转变为简短的纠正指令。在强化指令引导下,WAM执行这条指令返回预定的未来。然后它继续执行任务。 FAVOR 将基础 WAM 的任务成功率在 LIBERO 上从 97.85% 提高到 98.10%,在 LIBERO-Plus 上从 72.60% 提高到 72.98%,而无需修改策略。
