论文
SlotMem:用于生成叙事长视频的字符可寻址内存
SlotMem: Character-Addressable Internal Memory for Narrative Long Video Generation
摘要
在场景转换和长时间间隙中保持重复出现的角色身份是叙事长视频生成的主要挑战。针对全局一致性的方法通常使用与角色身份保存不相符的线索来检索记忆,而最近以角色为中心的变体仍然依赖于粗略的帧级 kv 记忆,将身份与偶然的视觉因素纠缠在一起,并且在有限的记忆容量下缺乏连续更新机制。为了解决这些限制,我们提出了 SlotMem,一种用于多字符叙事长视频生成的字符可寻址内部存储器框架。具体来说,SlotMem 使用字符语义探针从交叉注意力响应中定位与字符相关的视觉标记,并使用内存编码器将 DiT 标记压缩到紧凑的角色插槽内存中。随着生成的进行,记忆写入器会用新的观察结果保守地更新每个角色的记忆,而按字符交叉注意会检索角色记忆并将其仅注入到同一角色的本地化标记中。对多个叙事长视频生成基准的实验表明,SlotMem 比现有基准提高了远程字符一致性,同时保持了可比较的视频质量。我们的代码可在 https://github.com/YilaiLiu-HKU/SlotMem 获取。