论文

导航世界模型的视觉表示和历史建模

Visual Representation and History Modeling for Navigation World Models

模型架构混合架构

摘要

导航世界模型 (NWM) 预测行动条件下的视觉未来以进行规划。他们的设计核心有两个实际挑战:选择合适的视觉表示并为重复的候选查询有效地建模观察历史。标准 Global-Softmax 注意力提供了灵活的交互,但重复处理相同的历史记录,导致长上下文和多查询规划的计算和内存成本增加。我们在统一的条件流转换器框架内研究这两个问题。我们首先在相同的动力学模型和评估下比较五种冻结的视觉表示。为了减少冗余历史计算,我们设计了 Cached-Linear,这是一种混合架构,它将用于目标混合的本地和移位窗口注意力与用于可重用历史访问的线性注意力相结合。我们进一步开发了平衡门控增量网络(GDN),它通过用于时间历史建模的逐帧循环存储器增强了这种设计。 RECON、SACSoN 和 SCAND 上的实验表明,表示选择取决于预测目标:PAE-L 在重建方面表现最佳,RAE-B 在直接预测方面表现最佳,而 V-JEPA 在长期部署方面表现最佳。在共享历史工作负载下,与 Global-Softmax 相比,Cached-Linear 大大减少了计算和内存,而 Balanced GDN 通过高效的上下文重用改进了选定的直接预测端点。总的来说,我们系统地研究了 NWM 的视觉表示和历史建模,并开发了混合可重用历史架构,以实现高效的长上下文和多查询预测。