论文
音频 LLM 是听还是读?使用 VoxParadox 分析和缓解副语言故障
Do Audio LLMs Listen or Read? Analyzing and Mitigating Paralinguistic Failures with VoxParadox
摘要
音频 大语言模型(音频 LLM)在语音理解任务上表现出强大的性能,但它们理解副语言信息的能力仍然有限。为了系统地量化这个问题,我们引入了 VoxParadox,这是一个对抗性基准,拥有 2,000 个经过验证的示例,涵盖 10 个副语言任务,通过受控语音合成创建,故意不匹配转录声明和说话风格,从而能够直接测量语音副语言理解。对多种音频 LLM 的评估表明,声学 真值 的准确度始终较低,并且有很强的遵循语言暗示(不正确)答案的倾向。为了理解这种差距的原因,我们进行了分层探测,发现(i)副语言线索可能会在更深的编码器层和编码器-LLM接口处退化,以及(ii)即使此类线索在音频标记中可用,语言模型也经常忽略它们。为了解决这些问题,我们提出了提示条件层混合器(PCLM),它根据输入提示自适应地组合来自多个音频层的信息,并将其与直接偏好优化(DPO)配对,以明确首选声学支持的选项而不是语言隐含的替代方案。这些方法极大地提高了 Audio LLM 副语言理解,将 VoxParadox 上的 Audio Flamingo 3 从 17.40% 提高到 65.20%,将 MMSU 副语言子集从 37.74% 提高到 54.78%。我们的项目页面位于 https://voxparadox.github.io/。