论文

大型音频语言模型中声学感知的编码器侧神经元识别和放大

Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models

模型评测模型行为与机制分析

摘要

尽管在语音内容方面表现出色,但大型音频语言模型 (LALM) 在语音的细粒度非语义属性(例如说话者的情绪)方面通常表现不佳。在不花费重新训练成本的情况下改进这一点需要有效的推理时间干预,但大多数现有方法仅在音频编码器之后进行干预,并以相对粗糙的粒度进行操作。首先从波形中提取声学信息的编码器本身在很大程度上仍未被探索,特别是在单个神经元的水平上。我们介绍了 IAAN(识别和放大声学神经元),这是一种 无需训练 和无标签方法,通过将真实波形上的激活与缺乏真实音频声学信息的噪声参考上的激活进行对比,对音频编码器中的每个前馈神经元进行评分。然后,IAAN 会放大一小组推理时得分最高的神经元。在 10 个非语义语音属性中,IAAN 在 Audio-Flamingo-3 上的平均准确度提高了 25.7 点,在 Qwen2.5-Omni 上提高了 21.4 点,在 Kimi-Audio 上提高了 9.7 点。它还改进了已经明确微调以优先考虑声学证据的模型。在受控比较中,编码器位点和神经元级选择性都证明对于这种增益是必要的。在编码器之后、解码端或语言模型内部进行干预几乎不会产生任何改进,甚至会降低准确性。改进还取决于哪些特定神经元被放大,而不仅仅是其数量,这证实了 IAAN 的声学评分成功地识别了重要的神经元。这些结果表明,音频编码器内部的小规模、精确的针对性干预是加强 LALM 声学理解的有效且很大程度上尚未开发的方法,为推理时间方法开辟了新方向,通过神经元级访问编码器来改善声学感知。