论文
使用世界模型的仅行动扩散策略的时态逻辑指南
Temporal Logic Guidance for Action-Only Diffusion Policies with World Models
摘要
扩散策略可以实现多模式机器人行为,但在推理时选择行为模式的能力有限,尽管这种控制在人类机器人设置中是可取的。先前针对这种缺乏控制的解决方案是利用信号时序逻辑(STL)来表达人类意图,并为扩散策略推理提供相应的指导。然而,这些方法只能指导共同生成未来行动和状态的扩散政策,从而增加了复杂性和运行时间。我们提出了一种针对仅行动扩散策略的新颖指导方法,该方法使用单独的学习世界模型来实现 STL 鲁棒性的可微分评估,然后将其梯度注入扩散过程。这可以引导行为朝着约束满足的方向发展,而无需重新训练,从而在保持任务绩效的同时提高约束遵守率。在 Robomimic 的 Can Transport 任务中,我们的方法保持了 100% 的任务成功率,同时将约束违规从基线方法的 80% 以上减少到 4%。我们还讨论了提高鲁棒性和更复杂约束的扩展。