论文
MemLearner:学习查询视频世界模型的上下文记忆
MemLearner: Learning to Query Context memory for Video World Models
摘要
视频世界模型是交互式视频生成模型,可根据用户操作和历史视频帧预测未来的世界状态。视频世界模型的一个关键挑战是缺乏内存,导致长时间内生成的场景不一致。以前的方法将基于规则的上下文帧检索作为记忆进行探索,但它们无法在场景遮挡和动态对象的场景中进行泛化。我们提出了 MemLearner,一种基于学习的自适应上下文查询方法,使用查询标记来桥接上下文和预测标记。通过利用视频生成模型本身进行上下文查询,MemLearner 利用预先训练的视觉先验,无需从头开始训练其他模块,并结合了有效的训练和推理策略。我们收集具有场景遮挡和动态对象的长视频数据集,与相机姿势注释配对,并提出利用带注释的渲染和未注释的真实世界视频的多数据集训练策略。大量实验表明,MemLearner 在场景一致性和内存方面显着优于先前的视频世界模型,特别是在具有挑战性的遮挡和动态场景下。