论文
闪闪发光的不是音频:重新思考音频语言评估中的文本先验和音频依赖
All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation
摘要
大型音频语言模型在语音和音频基准测试中显示出一致的性能增益,但高分可能无法反映真实的听觉感知。如果模型可以在不处理声学信号的情况下回答问题,则基准测试无法作为听觉理解的衡量标准。我们提出了一个使用两个轴的诊断框架:文本先验,它仅根据文本和一般知识来衡量可回答性;以及音频依赖,它评估对声音信号的实际依赖性。通过三个基准评估八个 LALM,我们发现即使没有任何音频输入,模型也保留了 60-72% 的完整音频分数。而且,在需要音频的项目中,只有3.0-4.2%需要完整的音频片段;大多数可以使用本地化片段来解决。这些发现挑战了基准性能等于强大的音频理解的假设,我们得出了提高评估可靠性和基准设计的实用指南。