论文
大型音频语言模型的听觉错觉基准
Auditory Illusion Benchmark for Large Audio Language Models
摘要
长期以来,知觉错觉一直是人类认知的重要探索,揭示了知觉的偏见和局限性。在听觉领域,这种错觉为测试大型音频语言模型(LALM)是否复制人类感知倾向提供了独特的视角。尽管它们很重要,但大多数基准测试都集中在视觉错觉或一般音频任务上,而对听觉错觉的探索不足。为此,我们提出了 AIB,这是 LALM 的第一个听觉错觉基准,涵盖了音乐、声音和语音领域的十种代表性错觉,每一种都针对基于知识的先验的存在进行了注释。我们的方法将模型评估与受控的人类听力研究相结合,从而能够直接比较反应。结果显示出系统性差异:虽然大多数 LALM 对低水平的声学错觉保持信号忠实,但当涉及语言或音乐先验时,一些 LALM 表现出更像人类的反应,尽管没有模型与人类感知特征相匹配。这些发现凸显了当前 LALM 作为认知模型的局限性。通过将听觉错觉建立为严格的测试平台,我们的工作为探索神经黑盒模型和增进对听觉认知的理解提供了新的视角。 AIB 可在 https://github.com/gillosae/aib 上公开获取。