论文

听说过但没有注意到:音频语言模型中的副语言信息编码和丢失

Heard but Not Heeded: Paralinguistic Information Encoding and Loss in Audio-Language Models

模型评测模型行为与机制分析

摘要

音频语言模型旨在理解语音,但目前尚不清楚它们是否能够捕获所说内容以外的内容。我们使用具有受控说话风格的 Expresso 数据集,对四个开源模型 Whisper-large-v2、Qwen2-Audio-7B Instruct、Qwen2.5-Omni-7B 和 Chroma-4B 中的副语言信息进行机械分析。我们将居中内核对齐、线性探测与留一个说话人评估、开放式音调预测和内容韵律泄漏度量相结合,以跟踪风格信息如何从音频编码器移动到最终输出。所有模型都在后期编码器(即音频编码器层的前三分之一)中对说话风格进行强编码,但此信息在到达输出之前会持续降级。投影仪在不删除信息的情况下重塑表示几何形状,而解码器根据架构和训练目标保留的风格程度有所不同。在输出层面,模型分为两种行为。有些是内容驱动的,其中预测主要取决于文本。其他的是声学驱动的,其中预测因说话风格而异。泄漏指标量化了这种差异,定性结果证实了这一点。总体而言,我们确定了模型编码内容和使用内容之间的差距,突出了当前音频语言模型的一个关键限制。