论文

音频 LLM 知道何时听不清:从编码表示预测转写可靠性

Audio LLMs Know When They Can’t Hear You

模型评测鲁棒性、公平性与可信度评测

摘要

音频大语言模型允许用户通过语音与模型进行交互。当输入录音质量太差时,模型可能会误解用户的查询并根据不正确的转录进行响应。在本文中,我们研究模型条件转录可靠性:音频大语言模型是否能够识别其自身转录不可靠的情况。我们首先提示音频大语言模型评估其自己的转录是否可靠,并发现该模型对其自身转录可靠性的判断很差:在大多数情况下,它预测其转录将是可靠的。我们发现现有的方法,包括语音质量预测器、音频 LLM 生成不确定性和转录条件 WER 估计,为检测转录失败提供了有限的信号。相反,我们发现转录可靠性在模型的音频编码器表示中得到了强烈的体现。基于这一观察,我们设计了一种轻量级可靠性预测器,它对冻结音频编码器提取的表示进行操作,并在生成之前预测可靠性类别。当预测用户的语音查询不可靠时,可靠性预测器可以触发向用户请求澄清,同时允许可靠的查询继续进行,而无需修改底层音频 LLM。我们的预测器实现了 81.10% 的域内宏观 F1 分数和 78.09% 的跨域宏观 F1 分数,分别比最强的基线高出 10.33 分和 11.93 分。最后,我们证明可靠性标签可以跨音频 LLM 系列传输,并且传输性能与其特定于模型的可靠性边界的对齐密切相关。

转写可靠性数据构建:调整声学干扰强度,以参考转写计算WER并生成标签。
图3(图注摘要):转写可靠性数据构建:调整声学干扰强度,以参考转写计算WER并生成标签。