论文

LongAV-Compass:迈向跨 T2AV、I2AV 和 V2AV 的分钟级视听生成的统一评估

LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV

模型评测基准与评测资源

摘要

视听生成正在迅速从短片发展到一分钟长的内容,而现有的评估协议仍然主要局限于短片设置。现有基准主要关注 5--10 秒的文本调节生成,很少支持跨文本、图像和视频调节模式的统一评估。此外,它们对身份一致性、叙事连贯性和视听一致性如何随着时间的延长而退化的了解有限。为了弥补这一差距,我们推出了 LongAV-Compass,这是一个用于生成一分钟视听的系统基准。 LongAV-Compass 包含 284 个精选测试用例,涵盖文本到音频视频 (T2AV)、图像到音频视频 (I2AV) 和视频到音频视频 (V2AV),按应用场景和生成复杂性进行组织。该基准将分类法引导的基准构建与统一的评估框架相结合,该框架将 MLLM 辅助评估与互补的感知和多模态指标(包括 DINO-v2、ArcFace、CLIP 和 ImageBind)集成在一起。该框架评估了 20 多个细粒度维度,涵盖细分内质量、跨细分一致性、全局叙述连贯性、语义对齐和视听同步。通过对 11 个代表性模型进行实验以及人类对齐验证,LongAV-Compass 提供了一个诊断测试台,用于分析当前系统在跨不同输入模式维持连贯、语义对齐和时间一致的分钟级视听生成方面的局限性。