论文

代表但被忽视:音频语言模型中韵律未充分使用的因果关系

Represented but Ignored: A Causal Account of Prosodic Underuse in Audio-Language Models

模型评测模型行为与机制分析

摘要

人类的言语具有丰富的表现力,韵律携带着词汇内容之外的语言和情感信息。因此,一个强大的大型音频语言模型(audio-LLM)应该支持表达性语音理解,不仅转录所说的内容,而且解释所说的内容。然而,仅靠行为评估并不能揭示模型在韵律输入方面失败的原因。错误可能反映了声学信息的丢失、内部解释不正确或未能使用模型内部已有的表示。我们引入了一个阶段特定的探针梯子,用于定位音频 LLM 中的这些故障模式。在四个仅理解的音频 LLM 中,韵律信息通常保留在音频路径中,并且在后期 LLM 状态中可解码。然而,它仅部分地体现在模型的最终响应中。我们通过有针对性的隐藏状态干预来测试这种潜在表征的因果状态。每次干预都会使答案分布向预测的方向移动,并且在大多数模型任务单元中,相关层的一次编辑就足以驱动模型朝着抑制的韵律决策发展,尽管这种恢复是定向的,而不是选择性恢复正确的类别。特征级分析进一步表明,这种可恢复信号可以通过一个小的子空间来表达。此分析中的一些最高归因特征与已知携带韵律信息的声学线索相一致。在我们测试的匹配内容对比中,这些结果发现反复出现的瓶颈不在于感知韵律,而在于使用它。听到并正确表达韵律提示的模型仍然无法在答案中表达它。