论文
VidAudio-Bench:跨四个音频类别对 V2A 和 VT2A 生成进行基准测试
VidAudio-Bench: Benchmarking V2A and VT2A Generation across Four Audio Categories
摘要
视频转音频 (V2A) 生成对于沉浸式多媒体体验至关重要,但其评估仍未得到充分探索。现有的基准测试通常在统一协议下评估不同的音频类型,忽略了不同音频类别的细粒度要求。为了解决这一差距,我们提出了 VidAudio-Bench,这是一种用于 V2A 评估的多任务基准,具有四个主要特征:(1)广泛的覆盖范围:它包含 V2A 和视频文本到音频(VT2A)设置下的四个代表性音频类别 - 音效、音乐、语音和歌唱。 (2) 广泛评估:它包括 1,634 个视频文本对和 11 个最先进的生成模型的基准。 (3)综合指标:引入了13个特定于任务的、无参考指标来系统地评估音频质量、视频音频一致性和文本音频一致性。 (4)人类一致性:它通过主观研究验证所有指标,表现出与人类偏好的强一致性。实验结果表明,与音效相比,当前的 V2A 模型在语音和唱歌方面的表现较差。我们的 VT2A 结果进一步凸显了指令遵循和视觉基础生成之间的根本张力:更强的视觉调节可以改善视频音频对齐,但通常以生成预期音频类别为代价。这些发现将 VidAudio-Bench 确立为用于诊断 V2A 系统的全面且可扩展的框架,并为多模态音频生成提供了新的见解。