论文
反馈世界模型实现扩散政策的精确指导
Feedback World Model Enables Precise Guidance of Diffusion Policy
摘要
世界模型旨在通过预测行为的后果来改进机器人的决策。然而,在实践中,一旦机器人遇到训练分布之外的状态,他们的预测通常会变得不可靠,从而限制了它们在部署时的有效性。我们观察到执行本身提供了一个自然但未充分利用的信号:在每个动作之后,机器人直接观察真正的下一个状态,揭示预测结果和实际结果之间的不匹配。基于这一见解,我们提出了反馈世界模型,这是一种在推理时关闭预测和观察之间循环的新范式。我们的方法不是将世界模型视为静态开环预测器,而是维护一个轻量级反馈状态,该状态可以在线更新以迭代地纠正未来的预测,使用实时观察来补偿模型错误,而无需额外的训练数据或参数更新。我们表明,这个过程可以解释为潜在空间观察者,并在温和条件下承认收敛保证。我们进一步引入了动作感知指导,通过强调动作可控组件同时抑制不相关的变化,更好地将正确的预测转化为控制。 LIBERO-Plus、Robomimic 和现实世界操纵任务的实验表明,我们的方法大大提高了分布转移下的预测准确性和策略性能。特别是,它可以将世界模型预测误差降低高达 76.4%,并将分布外 (OOD) 成功率提高 30%。这些结果表明,在推理时结合实时反馈为静态世界建模提供了一种简单而强大的替代方案。