论文
HalluAudio:大型音频语言模型中幻觉检测的综合基准
HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models
摘要
大型音频语言模型 (LALM) 最近在各种以音频为中心的任务中取得了强大的性能。然而,幻觉(即模型生成语义上不正确或声学上不受支持的响应)在音频领域中仍然没有得到充分探索。现有的幻觉基准主要集中在文本或视觉上,而少数面向音频的研究在规模、模态覆盖范围和诊断深度方面受到限制。因此,我们推出 HalluAudio,这是第一个评估语音、环境声音和音乐幻觉的大型基准。 HalluAudio 包含超过 5K 个经过人工验证的 QA 对,涵盖多种任务类型,包括二元判断、多项选择推理、属性验证和开放式 QA。为了系统地诱发幻觉,我们设计了对抗性提示和混合音频条件。除了准确性之外,我们的评估协议还测量幻觉率、是/否偏差、错误类型分析和拒绝率,从而能够对 LALM 故障模式进行细粒度分析。我们对广泛的开源和专有模型进行了基准测试,首次提供了语音、声音和音乐的大规模比较。我们的结果揭示了声学基础、时间推理和音乐属性理解方面的重大缺陷,强调了对可靠和强大的 LALM 的需求。