论文
WALL-SS:通过下一代自回归扩展长期世界模型
WALL-SS: Scaling Long-horizon World Models via Next-Scale Autoregression
摘要
生成世界模型为机器人提供了世界在交互下如何演变的预测模型,在模拟、规划、政策评估和机器人学习方面具有越来越大的潜力。除了剪辑级别的未来预测之外,统一的生成公式应该将行动与结果联系起来,支持灵活的视野和持续的交互,并实现奖励驱动的优化。我们引入了 WALL-SS,这是一种世界模型,它通过按比例自回归缩放生成视觉未来,从而实现动作可控和长视野机器人模拟。 WALL-SS 将具体轨迹表示为时间交错的观察和动作的因果序列,使依赖于动作的状态转换变得明确,同时自然地支持可变长度生成、通过可重用因果状态进行流式扩展以及通过序列概率进行直接优化。为了使这个公式在长期范围内有效,我们以从粗到细的方式生成每个未来的观察结果,并在同一层次结构中开发三个互补的组件。以动作为条件的下一尺度预测注入了尺度一致的动作表示,以改善动作与未来的耦合,并对成功和失败的行为进行建模。尺度压缩的长视野记忆以高分辨率保留最近的相互作用,同时压缩遥远的观察和行动,尺度上的梦想迫使增强对自我生成的上下文的鲁棒性。最后,同策略 对齐通过动作跟踪和长期一致性奖励来优化自回归视觉动态,同时保留预训练的视觉分布。实验表明,WALL-SS 提高了动作跟踪和轨迹准确性,支持在有限内存下连贯的一分钟长流式生成轨迹,并始终受益于 同策略 对齐,减少动作漂移和长范围不一致。