论文
眼不见心不烦:动态视频世界模型的混合内存
Out of Sight but Not Out of Mind: Hybrid Memory for Dynamic Video World Models
摘要
视频世界模型在模拟物理世界方面显示出巨大的潜力,但现有的记忆机制主要将环境视为静态画布。当动态主体隐藏在视线之外并随后重新出现时,当前的方法常常会遇到困难,导致主体冻结、扭曲或消失。为了解决这个问题,我们引入了混合记忆,这是一种新颖的范式,要求模型同时充当静态背景的精确档案管理员和动态主体的警惕跟踪器,确保在视野之外的时间间隔内的运动连续性。为了促进这个方向的研究,我们构建了 HM-World,这是第一个专用于混合内存的大规模视频数据集。它具有 59K 个高保真剪辑,具有解耦的摄像机和主题轨迹,涵盖 17 个不同的场景、49 个不同的主题,以及精心设计的退出进入事件,以严格评估混合一致性。此外,我们提出了 HyDRA,这是一种专门的内存架构,它将内存压缩为词元并利用时空相关性驱动的检索机制。通过选择性地关注相关运动线索,Hydra 有效地保留了隐藏对象的身份和运动。 HM-World 上的大量实验表明,我们的方法在动态主题一致性和整体生成质量方面都显着优于最先进的方法。代码可在 https://github.com/H-EmbodVis/Hydra 上公开获取。