论文
声音去哪儿了?追踪音频 LLM 中的声学信息丢失
Where Does the Sound Go? Tracing Acoustic Information Loss in Audio-Conditioned LLMs
摘要
音频条件语言模型经常未充分利用韵律、情感和非语音等声学线索,这就提出了一个问题:ASR 监督的前端是否会在这些信息到达 LM 之前将其丢弃。我们通过在共享 Qwen3.5-4B 音频-LM 管道中对 ASR、情感识别和声音字幕进行比较 Whisper-Tiny 和 Whisper-Small 与 EnCodec、DAC-VAE 和 WavTokenizer 来测试前端是否负责。仅更换编码器并不能解决这种未充分利用的问题:Whisper 变体总体上仍然最强,包括在情感和环境声音字幕方面。为了定位故障,我们通过编码器、投影仪、LM 层和 LM head 跟踪任务相关信息。线性探针和几何分析表明,即使 MCQA 精度落后探针精度高达 83 个点,在最后的 LM 层仍然可以恢复有区别的声学结构。由于答案格式和解码过程受到控制,因此这种与任务相关的差距指向特定内容的读出失败,而不是通用格式偏差。 LogitLens 分析和有针对性的 LM 头干预支持这样的结论:声学使用不足不仅仅可以用编码器端信息丢失来解释,而且读出对齐可能是主要瓶颈。