论文

VGIF-Score:视频生成中时空指令跟踪的可解释和诊断评估

VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation

模型评测评测方法与指标

摘要

最近的视频生成模型(VGM)在视觉保真度方面取得了实质性进展,但它们遵循长的组合指令的能力仍然没有得到充分评估。现有的评估协议通常依赖于简短且语义浅薄的提示,具有有限的原子约束和弱的时空依赖性。它们还经常依赖于昂贵的人工评估或手工制作的视觉管道,同时几乎无法提供关于指令约束成功或失败的诊断见解。为了解决这一差距,我们提出了 VGIF-Score,这是一种高度自动化且可解释的框架,用于评估视频生成中的指令遵循情况。 VGIF-Score 由两个互补的组件组成:一个客观完成分支,将提示解析为时空有向无环图 (ST-DAG),并通过短路诊断执行依赖性感知 QA;以及一个主观满意度分支,使用指令条件 AutoRubric 来评估电影摄影、视觉纯度、运动平滑度和物理依从性。这些组件共同产生一个统一的分数,既体现了客观完成度,又体现了感知满意度。我们在 VGIF-Bench 上实例化了这个框架,这是一个由 223 个长的、结构纠缠的提示与大约 4.3K 细粒度评估项配对的基准。对超过 3K 生成视频的 14 个专有和开源 VGM 进行的实验表明,VGIF-Score 可以对遵循的视频生成指令进行可靠、可解释且在诊断上有用的评估。该代码可在 https://github.com/PRIS-CV/VGIF-SCORE 获取。