论文
用于一致长视频生成的补充检索增强提示
Complementary Retrieval-Augmented Prompting for Consistent Long-Form Video Generation
摘要
虽然最近的视频基础模型擅长生成高质量的短视频,但长视频生成仍然是一个严峻的挑战,其中的主要瓶颈在于调节独立生成的镜头以在整个故事中保持一致的角色、场景和对象。现有的免训练方法通常使用检索到的历史视觉效果来调节目标镜头。然而,这些参考文献经常遭受严重的信息不匹配,要么引入不相关的上下文冗余,要么无法提供目标镜头所需元素的完整组合。为了解决这个问题,我们提出了补充检索增强提示,这是一个 Agentic 框架,该框架战略性地聚合了一组紧凑的相互支持的历史参考,以实现长格式视频生成的完整和有针对性的调节,而无需重新训练或修改底层生成器。具体来说,我们的框架通过将叙事脚本解析为基于文本的视觉元素注册表来明确建模每个目标镜头所需的视觉元素,该注册表跟踪角色、对象、场景及其镜头级状态。带 VLM 注释的关键帧库进一步将这些元素映射到过去的视觉观察。在所需元素的指导下,我们的Agent检索互补参考,以最大化目标元素覆盖范围,同时最小化历史噪音。最后,检索到的引用、结构化元素状态和基础指令被组装成冻结视频生成器的统一提示。这种元素感知过程提供了全面的调节,同时保持完全可解释性。对多镜头故事生成的定量和定性评估表明,我们的方法在跨镜头一致性和文本可控性方面始终优于最近帧、基于内存和实体级检索基线。