论文

追踪音频语言模型中声学依据与答案选择的联系

Tracing Audio Grounding and Answer Selection in Audio LLMs

模型评测模型行为与机制分析

摘要

音频 大语言模型(音频 LLM)在音频理解方面取得了进步,但它们仍然可以通过文本提示或语言先验而不是提供的音频进行推理来预测答案。常见的补救措施是根据无法仅从文本推断出答案的数据来训练模型。这种方法可以提高性能,但模型内发生了什么变化仍不清楚。在本文中,我们询问模型内部必须发生什么,音频才能真正确定答案。我们的发现有三个方面。 (1) 用静音或不相关的音频替换音频会导致训练模型比预训练模型出现更大的性能下降。 (2) 声学信息最强烈地塑造了模型对早到中层答案选择的表示,而训练主要增加了音频信息对中到晚层最终预测的影响。 (3) 训练过程中学到的权重在特定层带中影响最大。总之,这些结果提供了训练如何加强音频 LLM 中声学证据的使用的机械说明。