论文

OmniMem:用于长视频生成的可扩展和自适应内存检索

OmniMem: Scalable and Adaptive Memory Retrieval for Long Video Generation

模型推理KV Cache

摘要

自回归 (AR) 视频生成通过顺序生成潜在块来扩展视频,但扩展到长视频需要重复访问不断增长的历史 KV 缓存。现有方法通过截断 KV 缓存或将其压缩到隐式内存中来降低此成本,但这两种方法都会失去对查询相关历史详细信息的显式访问。我们提出了 OmniMem,一个显式的全范围内存检索框架,可对历史缓存执行稀疏 KV 检索。为了使其适用于基于块的 AR 视频生成,OmniMem 解决了两个问题:(i) 稀疏 KV 选择中的局部偏差和 (ii) 内存访问中的联合爆炸。当有足够的远程历史记录可用时,自适应窗口排除会从选择候选中删除本地窗口块,从而为信息丰富的远程检索保留稀疏预算。查询共享 KV 选择减少了跨查询多样性,而每头分散 KV 访问避免了将特定于头的选择扩展到大型选定的 KV 缓冲区。这允许每个注意力头根据自己的选择模式检索非连续的 KV 块。长视频生成实验表明,OmniMem 将动态度提高了 52.3%,并在强基线上保持了强一致性,同时保持了可比较的内存使用量。