论文

DySink:用于自回归长视频生成的动态帧接收器

DySink: Dynamic Frame Sinks for Autoregressive Long Video Generation

上下文与知识上下文工程

摘要

自回归长视频生成通常采用有限内存流来提高效率,通常将本地窗口与静态早期帧接收器作为远程锚点结合起来以实现短期连续性。然而,即使当前视觉状态与早期帧有很大偏差,这种固定分配也会缓存早期帧,同时丢弃可能更相关的中间历史记录。因此,保留的远程上下文可能会变得适应性较差,并且会产生对过时线索的偏见;在严重的情况下,RoPE 引起的相位重新对齐可以使头部间的注意力均匀化并导致接收器崩溃,即内容向接收器框架回归。我们提出了 DySink,一种基于检索的框架,它维护紧凑的内存库并选择视觉相关的历史帧作为动态帧接收器。 DySink 将自适应检索与接收器异常门结合起来,过滤检索到的上下文,显示出过多的头间共识,这是与接收器崩溃相关的一种注意模式。对 50--100 秒视频的实验表明,DySink 在评估的自回归基线中实现了最高的测量时间质量,同时保留了有竞争力的文本对齐和帧质量。代码可在 https://github.com/yebo0216best/DySink 获取。