论文
HarnessWAM:连接世界行动模型中的预测和审议
HarnessWAM: Bridging Prediction and Deliberation in World Action Models
摘要
世界动作模型(WAM)共同学习环境动力学和机器人动作,将物理进化的先验引入到具体控制中。然而,有限范围的预测和动作生成不足以满足需要全局规划、跨阶段状态维护、执行验证和故障恢复的复杂具体任务。我们将这种不匹配称为 WAM 的预测-审议差距。为了解决这一差距,我们提出了 HarnessWAM,这是一种 WAM 代理框架。 HarnessWAM 采用基于视觉语言模型的任务管理器来维护基于证据的场景信念和结构化任务图。能力条件可执行空间投影进一步将开放式语义计划约束为满足任务依赖性、实施例状态约束和底层 WAM 能力边界的原子技能序列。在执行过程中,HarnessWAM 通过事件驱动的双时间尺度反馈循环进行操作:轻量级进度估计器持续提供高频执行证据,而任务管理器通过共同考虑当前观察、任务状态和交互历史来审议显着里程碑,以确定是否推进任务、获取额外观察、修改计划或启动本地恢复。这种机制使机器人能够在子任务失败后恢复其状态并恢复执行,而不会丢弃先前获取的场景知识。 HarnessWAM 在 RoboMemArena 上实现了最先进的完整任务和子任务成功率,分别为 59.6% 和 69.9%,在 RoboCerebra Ideal 上实现了 23.7% 的 SR。这些结果表明,模型外部结构化状态维护和闭环代理决策可以有效地将WAM的本地控制能力扩展到可计划、可验证和可恢复的具体任务执行中。