论文

AudioScape-TTA:用于细粒度文本到音频评估的结构化音景基准

AudioScape-TTA: A Structured Soundscape Benchmark for Fine-Grained Text-to-Audio Evaluation

模型评测基准与评测资源

摘要

文本到音频(TTA)生成最近在从自然语言描述合成真实音频方面取得了显着进展。然而,确定生成的音频是否忠实地满足复杂的文本指令仍然具有挑战性。现有的基准主要依赖于全局相似性度量,对细粒度语义故障的洞察力有限。为了解决这个限制,我们引入了 \textbf{AudioScape-TTA},这是一个用于细粒度 TTA 评估的结构化且复杂性感知的基准。 AudioScape-TTA 通过模态感知语义结构表示真实的音景,并使用事件密度和结构复杂性来表征生成复杂性。基于这些注释,我们提出了一个基于标题的基于音频的评估框架,该框架通过细粒度的语义标准来验证事件实现、声学属性和语音内容。该基准测试包含 2,258 个音频文本对和 25,707 个二进制 QA 评分标准,支持对 TTA 系统进行可扩展和可解释的分析。对 13 个代表性开源 TTA 模型的实验揭示了细粒度属性控制、语音内容保存和合成音景生成方面的持续局限性。人类验证进一步表明,与传统的全局相似性度量相比,我们基于标题的评估与人类语义判断实现了更强的一致性。