论文
长代码:将纯长上下文隔离为视频评估中的正交维度
Long-CODE: Isolating Pure Long-Context as an Orthogonal Dimension in Video Evaluation
摘要
随着视频生成模型实现前所未有的功能,对强大的视频评估指标的需求变得越来越重要。传统指标本质上是为短视频评估量身定制的,主要评估帧级视觉质量和局部时间平滑度。然而,随着最先进的视频生成模型扩展以生成更长的视频,这些指标无法捕获基本的长期特征,例如叙事丰富性和全局因果一致性。认识到短期视觉感知和长上下文属性本质上是正交维度,我们认为长视频指标应该与短视频评估分开。在本文中,我们重点关注长视频评估专用框架的严格论证和设计。我们首先引入了一套长视频属性损坏测试,暴露了现有短视频指标的关键局限性,因为它们对结构不一致(例如镜头级扰动和叙事洗牌)不敏感。为了弥补这一差距,我们设计了一种基于镜头动态的新颖的长视频指标,该指标对远程测试框架高度敏感。此外,我们还引入了 Long-CODE(长上下文作为视频评估的正交维度),这是一个专门用于对长视频评估进行基准测试的数据集,其中人工注释专门针对真实的远程特征进行了隔离。大量实验表明,我们提出的指标与人类判断实现了最先进的相关性。最终,我们的指标和基准无缝补充了现有的短视频标准,为视频生成模型建立了全面且公正的评估范例。