论文

FadeMem:用于自回归视频扩散的距离感知内存整合

FadeMem: Distance-Aware Memory Consolidation for Autoregressive Video Diffusion

模型推理KV Cache

摘要

自回归视频生成器通过生成连续的时间段来合成长视频,但其历史 KV 缓存会随着视频长度而增长。现有的有界缓存方法通过本地窗口、接收器词元或压缩内存状态来降低这种成本,但它们通常为历史的不同部分分配固定的角色。我们提出了 FadeMem,一种距离感知的 KV 内存整合机制,可在固定的缓存预算下将历史 KV 块组织成时间层次结构。这种设计的动机是频率相关的时间衰减:精细的细节快速去相关,而粗糙的场景结构和身份在较长的时间范围内仍然有用。在生成过程中,新的历史记录作为细粒度条目插入,而旧的相邻条目在幂律时间分配计划下逐步合并,从而在一个缓存内产生近稠密、远稀疏的存储器。在不改变架构的情况下,FadeMem 提高了远程一致性,同时很大程度上保留了视觉质量,轻量级自适应进一步增强了运动动态和视觉保真度。在固定缓存预算下使用相同的统一调度,FadeMem 在生成多分钟和一小时长的视频时仍然有效,并在匹配的 KV 预算下减少峰值内存。