论文
GroundShot:通过基于实体的镜头调度生成视觉一致的多镜头长视频
GroundShot: Visually Consistent Multi-Shot Long Video Generation via Entity-Grounded Shot Scheduling
摘要
生成视觉上一致的多镜头视频仍然是一个开放的挑战。随着视频跨越更多镜头,不一致的情况可能会在各个镜头中累积,导致镜头中重新出现的实体(角色、物体和位置)与它们最初出现的方式有所不同。我们观察到,观众通过将一个实体后来的每次外观与其第一次清晰的外观进行比较来判断一致性;最初外观的视觉质量为后续所有内容设定了一致性上限。受此启发,我们提出了 \textbf{GroundShot},一个 无需训练,用于基于实体的多镜头生成的与模型无关的代理框架。 GroundShot 根据接受的生成镜头在线构建实体级视觉记忆:它根据镜头作为实体引用的预期用途来安排镜头的生成顺序,根据生成的视频中的实体,在将其添加到内存之前验证其可靠性,并在生成每个镜头之前从内存中检索合适的实体引用。为了评估这种以实体为中心的一致性视图,我们进一步引入了 \textbf{GroundBench},这是一种诊断基准,可以在隔离受控挑战维度的同时测量实体级别的一致性。实验表明,GroundShot 比现有方法提高了多镜头一致性,同时不需要额外的训练或模型修改。