论文
DiLA:解开潜在行动世界模型
DiLA: Disentangled Latent Action World Models
摘要
潜在动作模型 (LAM) 通过推断连续帧之间的抽象动作,可以从未标记的视频中学习世界模型。然而,LAM 面临着动作抽象和生成保真度之间的根本权衡。现有方法通常通过使用预先训练的世界模型的两阶段训练或将预测限制为光流来规避这个问题。在本文中,我们介绍了 DiLA,一种新颖的解缠潜在动作世界模型,旨在通过内容结构解缠来解决这种权衡。我们的主要见解是,解缠和潜在动作学习是共同进化的:潜在动作学习固有的预测瓶颈是解缠的驱动力,迫使模型将空间布局提炼到结构路径中,同时将视觉细节卸载到单独的内容路径中进行生成。这种协同作用产生了连续的、语义结构化的潜在动作空间,而不影响生成质量。 DiLA 在视频生成质量、动作传输、视觉规划和多种可解释性方面取得了卓越的成果。这些发现将 DiLA 确立为一个统一的框架,可同时实现高级动作抽象和高保真度生成,推进自监督世界模型学习的前沿。