论文

TORUS:统一音频模型的渲染理解自相干性测试

TORUS: A Test of Rendering-Understanding Self-Coherence for Unified Audio Models

模型评测基准与评测资源

摘要

能够进行音频理解、音频生成以及越来越多的音频编辑的统一音频模型正在迅速普及。然而,关于它们的一个基本问题仍未得到解答:统一模型的两个头是否同意相同的音频?当前的实践是在专门的基准上单独评估每种能力,并且从不询问模型是否能够理解它自己的世代。我们推出了 TORUS,这是第一个针对音频原生统一模型的自相干测试。 TORUS 包括 48 个三阶段自我连贯性测试,包含 432 个六选项问题,涉及五个任务系列的语音、声音和音乐。我们全面评估五个开放统一模型以及结合了最先进的专业生成、编辑和理解模型的级联基线。最好的统一模型回答了 50.5% 的问题,而级联基线的回答率为 63.2%,机会下限为 16.7%。模特们在音频编辑方面遇到了困难。在评估的音频模型(专业和统一)中,我们观察到有限的自相干性,因此将自相干性定位为未来音频系统的基本测试。