论文

DEAF:音频语言模型声学忠实度的诊断评估基准

DEAF: A Benchmark for Diagnostic Evaluation of Acoustic Faithfulness in Audio Language Models

模型评测基准与评测资源

摘要

近期的音频多模态大语言模型(Audio MLLM)在语音基准上表现出色,但这些模型究竟是真正处理声学信号,还是依赖基于文本的语义推断,仍不清楚。为系统研究这一问题,我们提出DEAF(Diagnostic Evaluation of Acoustic Faithfulness,声学忠实度诊断评估),一个包含2,700余个冲突刺激的基准,涵盖三个声学维度:情感韵律、背景声音和说话人身份。随后,我们设计了一个受控的多层次评估框架,逐步增强文本影响——从内容中的语义冲突到误导性提示再到二者组合——使我们能够区分内容驱动的偏差与提示诱发的迎合行为。我们进一步引入诊断指标,量化模型对文本线索相对声学信号的依赖程度。我们对七个Audio MLLM的评估揭示出一致的文本主导模式:模型对声学变化敏感,但预测主要由文本输入驱动,这暴露出标准语音基准上的高性能与真正声学理解之间的差距。