论文

世界行动模型的未来锚定验证和在线恢复

Future Anchored Verification and Online Recovery for World Action Models

智能体系统Agent 工具调用

摘要

世界行动模型(WAM)已成为机器人操纵的一个有前途的范例。他们首先预测任务应该如何执行,然后解码未来的行动。然而,一旦执行偏离预测,其余操作就无效。简单地从已经偏离分布的状态重新规划很少能恢复任务仍然需要的内容;现有的执行监视器决定何时停止,但不决定恢复什么。我们观察到答案已经在手:WAM 在采取行动之前预测的未来准确地描述了它想要经历的状态。我们引入了 FAVOR(Future Anchored Verification and Online Recovery),这是一个轻量级框架,它将这些预测帧保留为锚点并将其用于验证和恢复。锚验证器将每个观察值与其锚以及执行的操作进行比较,以标记破坏任务的偏差。锚引导恢复使用视觉语言模型将标记的锚转变为简短的纠正指令。在强化指令引导下,WAM执行这条指令返回预定的未来。然后它继续执行任务。 FAVOR 将基础 WAM 的任务成功率在 LIBERO 上从 97.85% 提高到 98.10%,在 LIBERO-Plus 上从 72.60% 提高到 72.98%,而无需修改策略。

世界行动模型的未来锚定验证和在线恢复的原论文方法或结果图
图2:FAVOR总览。(a)冻结的WAM预测未来帧,IDM解码动作块,预测帧保留为锚点。每隔$\Delta$步,验证器对比观察与锚点;通过则继续执行,失败则中断剩余动作并触发恢复。(b)锚点验证器使用DINO编码预测—观察对,与动作和时间范围嵌入融合,通过因果GRU输出失败分数,超过$\tau$则报警。(c)锚点引导恢复:VLM读取触发报警的锚点、当前观察和任务,给出纠正指令。