论文
Latent-Foresight:潜在世界模型的端到端学习可预测表示
Latent-Foresight: End-to-End Learning Predictable Representations for Latent World Models
摘要
预测场景的未来演变是世界建模的一项基本功能。最近的工作表明,在视觉基础模型(VFM)的特征空间中进行操作可以产生丰富的语义表示,支持各种未来场景理解任务。然而,现有方法依赖于两级管道,其中首先使用固定降维(例如 PCA)或独立训练的自动编码器来压缩 VFM 特征,并在所得的冻结潜空间之上训练单独的预测器。表示学习和时间预测之间的这种解耦,以及直接在原始 VFM 特征上应用预测器的方法,并不能保证潜空间的结构可用于可预测的动态。在这项工作中,我们提出了 Latent-Foresight,这是一个端到端框架,它共同学习潜在标记器和基于流的生成动力学模型,显式地塑造表示以支持时间可预测性。为了实现稳定的关节优化,我们引入了几个关键的设计选择,以防止潜在的崩溃并使重建与生成目标保持一致。大量的实验表明,我们的方法可以学习更多时间连贯的潜在表示,并且在多个未来场景理解任务和预测范围内始终优于两阶段基线,同时消除了单独的训练阶段,包括在高分辨率适应期间。我们在 https://github.com/Sta8is/Latent-Foresight 提供实现代码和模型权重