论文
RAIL:使用基于 CHC 的基准重新思考大型音频语言模型中的听觉智能
RAIL: Rethinking Auditory Intelligence in Large Audio-Language Models with a CHC-Grounded Benchmark
摘要
人类通过音频感知、音频推理和记忆等紧密集成的认知能力来处理丰富的听觉环境。尽管大型音频语言模型(LALM)在语音理解和多模态音频推理方面最近取得了进展,但当前的评估范式仍然主要以任务或模态为中心,注重最终表现,而忽视了潜在的听觉认知行为。这揭示了人类如何理解听觉认知与 LALM 中如何评估听觉认知之间存在根本差距,特别是缺乏将认知原则操作到任务级指标之外以系统地捕获模型行为的框架。在这项工作中,我们引入了 RAIL,这是一种基于 Cattell-Horn-Carroll (CHC) 认知框架的以人为中心的评估范式。 RAIL 将听觉认知形式化为五项核心功能,并将其发展为结构化评估任务,探索模型如何处理、保留和整合听觉信息。我们进一步构建了一个基于认知的基准,具有原则性的数据管理和人性化的评估协议。通过评估 26 个最先进的 LALM,我们发现当前模型在认知能力方面表现出极不平衡的表现。 RAIL 建立了一种新的评估范式,超越了以任务为中心的基准测试,转向基于认知的听觉智能评估。