论文
PersonaShot:多镜头视频生成中以人为中心的叙事连续性基准测试
PersonaShot: Benchmarking Person-Centric Narrative Continuity in Multi-Shot Video Generation
摘要
视频生成正在从单镜头剪辑迅速发展为多镜头叙事,其中人物角色是核心叙事锚。然而,现有的基准主要评估角色外观或单个镜头的质量,而没有衡量身体和情绪状态在剪辑中是否保持一致。尽管物理连续性、面部动态和电影关系需要不同的视觉、时间和关系证据,但他们也很少提供特定标准的评估方法。为了解决这些限制,我们引入了 PersonaShot,这是第一个以人为中心的多镜头视频生成中叙事连续性基准。 PersonaShot 包含大约 1,000 个多镜头片段和 16 个涵盖物理连续性、情感动态和电影语法的指标。 \textbf{\textit{1)} 叙事连续性基准:} 我们评估三个时间级别上的角色连贯性:镜头内状态、跨镜头过渡和序列级轨迹。 \textbf{\textit{2)} 与人类保持一致的专家评估器:}我们将大型多模式教师的推理提炼为轻量级的特定标准评估器,每个评估器都基于其度量所需的视觉、时间或关系证据,并将其与人类专家的判断保持一致。 \textbf{\textit{3)} 系统评估和见解:}我们的评估揭示了最先进模型的独特能力概况,以及感知质量和跨镜头叙事连续性之间的明显差距。即使是视觉上引人注目的视频也经常会表现出物理状态重置、情感突然转变以及镜头之间破碎的电影关系。人体研究进一步证明了我们的评估者和专家判断之间的强烈一致性。