论文
回顾:连贯故事可视化的轻量级参考基础
ReCap: Lightweight Referential Grounding for Coherent Story Visualization
摘要
故事可视化旨在生成一系列图像,忠实地描绘文本叙述,在叙述展开时保留人物身份、空间配置和风格连贯性。维持这种跨框架一致性传统上依赖于显式内存库、架构扩展或辅助语言模型,导致大量参数增长和推理开销。我们引入了 ReCap,这是一个轻量级的一致性框架,可以在不修改基础扩散主干的情况下提高角色稳定性和视觉保真度。 ReCap 的核心(条件框架引用)模块将照应词(在我们的例子中为代词)视为视觉锚点,仅当代词引用字符时才激活,并以前一帧为条件来传播视觉身份。这种选择性设计避免了无条件跨帧调节,并且仅引入了 149K 个附加参数,这只是存储体和 LLM 增强方法成本的一小部分。为了进一步稳定身份,我们结合了仅在训练期间应用的 SemDrift(引导语义漂移校正)。当文本模糊或有参考意义时,降噪器缺乏用于身份定义属性的视觉锚点,导致字符外观在帧之间漂移,SemDrift 通过将降噪器表示与预训练的 DINOv3 视觉嵌入对齐来纠正此问题,以零推理成本强制执行语义身份稳定性。 ReCap 在故事可视化的两个主要基准上均优于之前最先进的 StoryGPT-V,在 FlintstonesSV 上的角色准确度为 2.63%,在 PororoSV 上为 5.65%,在两个基准上建立了新的最先进的角色一致性。此外,我们将故事可视化扩展到源自真实电影的以人为中心的叙事,展示了 ReCap 超越程式化卡通领域的能力。