论文

Echo-Forcing:用于交互式长视频生成的场景记忆框架

Echo-Forcing: A Scene Memory Framework for Interactive Long Video Generation

模型推理KV Cache

摘要

自回归视频扩散模型通过局部注意力和 KV 缓存实现开放式生成。然而,现有的无需训练长视频优化方法主要侧重于单一提示下的稳定扩展,难以处理涉及提示切换、旧场景遗忘、历史场景回忆等交互场景。我们将核心瓶颈确定为历史 KV 状态的功能纠缠:稳定的锚点和最近的动态由相同的缓存策略处理,导致过时的背景污染、对新提示的延迟响应以及远程内存的丢失。为了解决这个问题,我们提出了 Echo-Forcing,一种专为交互式长视频生成而设计的 无需训练 场景记忆框架,具有三个核心机制:(1)分层时间记忆,在相对 RoPE 下解耦稳定锚点、压缩历史和最近窗口; (2)Scene Recall Frames,将历史场景压缩为空间结构的KV表示以支持长期回忆; (3)差异感知记忆衰减,根据新旧场景之间的差异自适应地忘记冲突的标记。基于这些设计,Echo-Forcing 在有限的缓存预算下统一支持平滑过渡、硬剪切和远程场景调用。对 VBench-Long 的广泛评估进一步表明,Echo-Forcing 在长视频生成和交互式视频生成设置中均实现了最佳整体性能。我们的代码发布在https://github.com/mingqiangWu/Echo-Forcing