论文
教视频生成器记住:为视线之外的状态演化引入动态记忆
Teaching Video Generators to Remember: Eliciting Dynamic Memory for Out-of-Sight State Evolution
摘要
当没有观察到证据时,视频世界模型应该保持不断发展的状态,但当前的生成器通常会在中断时冻结隐藏状态。这不仅仅是一个容量问题:预训练的视频扩散 Transformer 已经拥有能够非本地检索的 KV 缓存机制,但它们很少被训练为将其用作动态内存。我们介绍了 ReMind,这是一个通过面向内存的数据、事件感知训练和缓存适应来引发动态内存行为的框架。我们围绕 100 多个动态事件的分类进行组织,构建了一个摄像机注释的训练混合物,结合了 VLM 过滤的真实视频、生成的硬动态、合成摄像机循环和内存中断增强。每个剪辑都会转换为具有受保护锚点、降级间隔和显式时间间隙的帧图。节点结构的课程——包括节点丢弃、噪声记忆、前沿延续和参考缓存训练——迫使模型跨中断检索相关的过去状态,而不是仅仅依赖局部连续性。 PM-RoPE 是一种优雅的相机阶段 RoPE 扩展,它以单注意力成本解锁时空检索,同时保留预先训练的路径。 ReMind 在 STEVO-Bench 和恢复任务上获得了最佳总体得分。此外,一般图像到视频的评估证实该课程可以避免灾难性遗忘。我们已经在项目页面\href{https://remind-applied.github.io/}{https://remind-applied.github.io/}上发布了我们的代码、数据和模型。