论文

RECAP-Forcing:保留长视频生成的内容外观

RECAP-Forcing: Retaining Content Appearances for Long Video Generation

模型推理KV Cache

摘要

长自回归视频生成面临着基本的记忆挑战:在有限的注意力窗口下,模型必须决定保留不断扩展的历史中的哪些信息。现有的方法按时间组织内存,保留最近的帧,同时压缩或丢弃较旧的帧。相反,我们提出 RECAP-Forcing,通过外观新颖性来组织记忆。长视频不仅仅是一系列帧,而且是不断变化的主体、物体和场景,其身份必须随着时间的推移保持一致。我们通过保留与新出现的内容相关的 KV 缓存来组织内存——例如进入主题、排除的区域和新引入的场景——在它第一次变得可见时,优先考虑新颖性而不是新近性。内存应该随着新引入的内容量而不是视频长度而扩展。这种外观索引记忆使远程一致性成为记忆结构的显式属性。我们的框架在这​​个单一原则下统一了两种机制。在视频开始时,当所有可见内容都是新颖的时,注意力接收器会保留初始场景。随着视频的发展,基于光流的新颖性银行通过有选择地保留新显示的内容来扩展相同的原理。作为一种无需额外可学习参数的 无需训练 推理方法,RECAP-Forcing 在多个强基线上持续提高视觉质量和语义保真度,并优于现有的记忆方法。