论文
RIWANav:策略与世界模型递归自改进的城市导航
RIWANav: Recursive World-Action Models with Self-Improvement for Urban Navigation
摘要
长视野城市导航需要连续的局部决策,其错误会随着时间的推移而加剧。模仿学习(IL)很少从失败中学习,而物理试错强化学习(RL)成本高昂。动作条件世界模型可以通过预测候选动作的视觉后果来提供想象的反馈。然而,随着策略的发展,冻结的世界模型可能会变得不太可靠。在本文中,我们介绍了 RIWANAV,这是一个 后训练框架,它将世界模型和动作模型(策略)的耦合适应转换为特定于任务的递归自我改进(RSI)。每个周期交替进行两次更新。世界模型通过想象的结果评估策略行动,为相对于群体的策略优化(GRPO)提供比较反馈。然后,改进后的策略构建了一个接地的自学课程,通过行为新颖性和预测误差来选择专家一致的动作视频对。精致的世界模型为下一个策略更新提供反馈,从而关闭递归自我改进循环。实验表明,RIWANAV 优于训练基线和先前方法,验证了策略和世界模型之间所提出的递归自我改进循环。现实世界的试验进一步证明了其实际适用性。
