论文
从用户视频集合中记忆引导生成 B-Roll
Memory-Guided B-Roll Generation from User Video Collections
摘要
我们引入了一种基于集合的 B-roll 序列生成方法。给定用户的视频集合、以自然语言给出的指令和目标持续时间,目标是生成一个多镜头序列,补充用户的主要镜头(A-roll),同时保留集合的角色、设置、对象和风格。这项任务具有挑战性,因为人们必须从数小时捕获的镜头中选择视觉证据,以指导序列中每个镜头的生成。我们通过 MemComposer 解决了这一挑战,这是一个三阶段系统,可将原始素材转化为具有视觉参考(角色、设置、对象和风格)的结构化记忆,并使用它来规划、检索和生成grounding的 B 卷序列。首先,在一次性离线阶段,MemComposer 从原始视频构建以实体为中心的内存。其次,它使用内存和用户指令来规划grounding序列并检索每个镜头的调节帧。第三,它迭代地生成和批评序列以强制身份、设置和序列级别的一致性。我们在用户偏好研究中从两个维度评估 MemComposer:提示依从性和与用户收藏的视觉对齐。与不grounding气的文本到视频规划器相比,MemComposer 赢得了 60.0% 的提示依从性和 92.8% 的视觉对齐比较,显示了集合记忆和参考检索的grounding优势。与从捕获的镜头组装的仅检索序列相比,MemComposer 在提示遵守性比较中赢得了 94.5%,显示了生成缺失镜头的价值,而在 58.2% 的比较中,仅检索序列更适合视觉对齐。