论文
仔细研究大型音频语言模型的时间理解中的故障模式
A Closer Look at Failure Modes in Temporal Understanding of Large Audio-Language Models
摘要
大型音频语言模型 (LALM) 在各种音频理解任务上取得了出色的性能,但在时间推理方面仍然存在困难,而时间推理是人类听觉感知的核心基本能力。了解这些故障的原因仍然具有挑战性,因为现有的基准测试报告性能差距而没有探究潜在的机制。为了解决这个问题,我们引入了一个基准,其中包含专为机械分析设计的三项基础任务的 1,657 个问题。检查不同输入设置下的模型输出(行为分析)表明,当文本提示可用时,模型通常未充分利用音频。我们还首次对 LALM 中的时间推理失败进行了因果机制分析。将注意力增加与缩放进行比较,我们发现在音频标记之间重新分配注意力比增加音频注意力更有效。瞄准与任务相关的标记会产生进一步的收益。这些发现表明,仅模式不平衡无法解释失败。在没有 微调 的情况下,瓶颈层的注意力扩展将准确性从 55.9% 提高到 59.1%,这为未来的工作展示了一个有希望的方向。