论文

DF$^3$:通过自主导航中的无解码器特征预测进行世界建模

DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation

模型架构Transformer

摘要

从视频序列预测未来状态是自主机器人系统的一项关键挑战,也是世界建模的基本目标。先前在像素级操作的生成方法不可避免地过分强调与任务无关的细节,导致计算开销过高。虽然基于潜在的方法试图通过直接预测特征来缓解这一问题,但对状态到任务映射的大量解码器的持续依赖仍然是计算瓶颈。在这项工作中,我们提出了无解码器特征预测(DF$^3$),这是一种完全在潜在空间内模拟世界演化并直接导出任务输出的新颖框架,完全消除了对解码器的需要。具体来说,DF$^3$ 将可学习的空间查询注入到冻结视觉基础模型的接线盒中,以直接提取未来状态表示。通过采用轻量级、统一的运动感知上下文融合 (MACF) 机制,将粗流扭曲与细粒度潜在互相关无缝集成,这些查询与历史标记表示交互,以显式对齐和预测下一帧的特征。随后,一组专门的任务查询探测下游任务的这些预测特征。对公共基准和机器人模拟器中的零射击部署进行的大量实验表明,DF$^3$ 实现了与最先进方法相当的性能,同时为集成感知和控制提供了卓越的效率和灵活性。