论文
MMAG:多控制混合音频生成基准
MMAG: A Multi-Control Mixed Audio Generation Benchmark
摘要
最近的音频生成系统已经从单模态合成发展到生成包含语音、音乐和声音效果的复杂声学场景。因此,评估这些模型需要评估多种交互能力,包括语义保真度、说话者一致性和时间控制,但现有的基准测试侧重于孤立域或粗粒度描述。为了解决这一差距,我们引入了多控制混合音频生成 (MMAG) 基准测试。 MMAG 包含大约 4,000 个手动验证的音频剪辑,具有丰富的注释,涵盖语音内容、说话者身份、音乐属性、声音事件和时间关系,以及用于语音克隆和时间戳条件生成的专用子集。我们进一步提出了一种系统评估协议,用于测量声音保真度、语音质量、语义对齐和时间准确性。对代表性代理编排器、统一视听生成模型和本机混合音频生成器进行基准测试揭示了这些功能之间的巨大性能权衡,但没有任何现有模型能够始终表现良好。我们的结果突出了可控混合音频生成的剩余挑战,并将 MMAG 确立为未来研究的综合基准。