论文

AV-SyncBench:时间和语义视听同步的解耦基准测试

AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization

模型评测基准与评测资源

摘要

视听特征提取是多模态理解和生成任务的基本组成部分。然而,现有的特征提取模型评估协议存在维度偏差,通常侧重于语义匹配或时间偏移检测。此外,它们的数据构造仍然是耦合的,妨碍了对时间和语义一致性的独立评估。我们提出了 AV-SyncBench,这是第一个完全分离视听同步的时间和语义评估的基准。它以野外视频为基础,涵盖语音、音乐和声音,涵盖 10 个场景和 5 个挑战任务。数据自动过滤并手动验证,确保屏幕上的声源。该基准包含 3,269 个视频和 38,390 个样本,我们评估了五个代表性模型来量化对齐和下游任务的特征质量。代码和数据集可在以下位置获取:https://fgt7t6g.github.io/AV-SyncBench。