论文
MRMAD:多轮多音频的音质退化理解评测
MRMAD: A Multi-Round Multi-Audio Benchmark for Evaluating Acoustic Degradation Perception in Large Audio-Language Models
摘要
大型音频语言模型(LALM)在理解语音、音乐和一般声音事件方面已经显示出有希望的进展,但它们推理音频信号如何退化的能力仍未得到充分探索。现有的基准测试主要评估语义理解、事件识别或高级音频推理,而没有回答一个基本问题:LALM 是否理解音频质量的差异?我们引入了 MRMAD,这是一种多轮多音频降级基准,用于评估 LALM 中的音频降级感知和理解。 MRMAD 涵盖语音、音乐和声音,并将评估框架为跨多个音频输入的多轮对话,要求模型识别退化类型、比较严重性并感知轮次之间的损坏变化。与当前的单轮音频语言基准不同,MRMAD 评估 LALM 是否可以通过新证据维持一致的退化假设,并理解多轮对话中的底层声学现象。通过对从非思考到推理和 Omni 模型的 18 个代表性 LALM 进行系统评估,我们发现当前模型经常识别粗略的内容,而无法可靠地诊断、比较或推理退化。人类评估进一步揭示了 LALM 和人类听众之间的显着感知差距。因此,MRMAD 揭示了音频语言理解的一个关键但被忽视的方面,并为构建对现实世界声学条件具有鲁棒性的未来 LALM 提供了诊断基础。