论文

EntityBench:实现实体一致的长距离多镜头视频生成

EntityBench: Towards Entity-Consistent Long-Range Multi-Shot Video Generation

模型评测基准与评测资源

摘要

多镜头视频生成将单镜头生成扩展到连贯的视觉叙事,但在长序列中保持跨镜头的角色、对象和位置的一致性仍然是一个挑战。现有的评估通常使用独立生成的提示集,其实体覆盖范围有限且一致性指标简单,使得标准化比较变得困难。我们引入了 EntityBench,这是一个源自真实叙事媒体的 140 集(2,491 个镜头)的基准,具有明确的每个镜头实体计划,可在多达 50 个镜头的简单/中/难级别中同时跟踪角色、对象和位置、13 个交叉镜头角色、8 个交叉镜头位置、22 个交叉镜头对象以及跨越最多 48 个镜头的重复间隙。它与三支柱评估套件配对,可解开镜头内质量、提示跟随对齐和交叉镜头一致性,以及仅允许准确的实体外观进入交叉镜头评分的保真度门。作为基线,我们提出了 EntityMem,这是一种内存增强生成系统,可在生成开始之前将经过验证的每个实体视觉引用存储在持久内存库中。实验表明,在现有方法中,跨镜头实体一致性会随着重复距离的增加而急剧下降,并且显式的每个实体记忆可在评估的方法中产生最高的字符保真度(Cohen's d = +2.33)和存在性。代码和数据可在 https://github.com/Catherine-R-He/EntityBench/ 获取。