论文

LayerRecall:用于视频生成中的长视野一致性的状态调节内存路由器

LayerRecall: A State-Conditioned Memory Router for Long-Horizon Consistency in Video Generation

模型推理KV Cache

摘要

自回归视频扩散通过从有限的最近上下文生成块来实现可扩展的长视频生成。虽然基于新近度的缓存保留了本地连续性,但它消除了主题、对象、场景或属性重新出现时所需的历史线索。现有的内存机制将模型暴露给非本地历史,但单独访问并不能确保有效使用。我们的分析表明,视频 DiT 层对当前、最近和遥远的上下文表现出不同的偏好,这表明长期记忆需要决定检索什么以及在哪里使用它。我们引入了 LayerRecall,一种电流调节的层选择性内存路由器,它检索相关的历史 K/V 状态,并将它们仅注入到骨干特定的内存敏感层,同时在其他地方保留本地注意力。为了减少对稀缺的高质量长视野视频和显式内存分配标签的依赖,我们进一步提出了跨视野预测匹配(CHPM),它使用特权长上下文参考来监督预测空间中的有界内存路由器。在 100 个多镜头评估提示中,LayerRecall 在 MemoBench 和 MovieBench 上取得了最佳整体结果,同时在 VBench-Long 上匹配了其骨干网,在不牺牲局部连续性的情况下展示了更强的远程恢复能力。定性分析进一步揭示了记忆引导的自我校正,从而使最初不匹配的局部属性恢复到其历史外观,而无需重置正在进行的运动或场景结构。其他分析显示跨主干网的可移植性和可忽略的推理开销。