论文
通过 无需训练 身份感知记忆推进叙事长视频生成
Advancing Narrative Long Video Generation via Training-Free Identity-Aware Memory
摘要
自回归视频生成在视觉保真度和交互性方面迅速提高,但仍面临长期不一致和内存退化的问题。大多数现有解决方案要么使用预定义策略压缩历史帧,要么基于粗略隐式注意信号检索关键帧,这两种解决方案都无法处理随着实体引用变化而不断变化的提示,从而导致身份漂移、字符重复和属性丢失。为了解决这个问题,我们提出了 IAMFlow,这是一种 无需训练 身份感知记忆框架,它显式地建模和跟踪持久实体身份,从而实现跨提示转换的一致生成。具体来说,LLM 从每个提示中提取具有视觉属性的实体,并为身份感知内存分配唯一的全局 ID,而 VLM 异步验证和细化渲染帧中的属性,从而实现显式实体跟踪,而不是基于隐式相似性的匹配。为了保持所提出的框架在计算上的实用性,我们设计了一个系统的推理加速管道,包括异步视觉验证、自适应提示转换和模型量化,其生成速度比现有基线更快。此外,我们还引入了 NarraStream-Bench,这是叙事流视频生成的基准,具有跨越六个维度的 324 个多提示脚本和集成了传统指标和基于 大语言模型 的多模态评估的三维评估协议。大量实验表明,IAMFlow 尽管是 无需训练,但在 NarraStream-Bench 上实现了最佳整体性能,比最强基线高出 2.56 个点,同时在 60 秒多提示设置中比最高效基线实现了 1.39$\times$ 加速。