论文

Whisper-Aware LLM:用自监督不确定性学习增强耳语识别

Whisper-Aware LLM: Self-Supervised Uncertainty Learning for Robust Whispered Speech Recognition

模型推理解码与生成控制

摘要

耳语语音的信号模糊性促使 ASR 系统走向两种相反的故障模式:无法捕获耳语语音或噪声的幻觉转录。本文介绍了 Whisper-Aware LLM,这是一个教导 Audio-LLM 感知这种不确定性并做出反应的框架。我们的模型通过有针对性的自我监督任务学习量化声学信号的物理缺陷,从而形成内在的自我意识。然后,这种学习到的不确定性通过一种新颖的置信融合解码机制进行操作,该机制为 LLM 解码器提供高级指令和帧级注意力调制。我们的实验证实了这种方法的有效性。该模型在低声语音方面树立了新的最先进水平,AISHELL6-Whisper 的 CER 相对降低了 17%。同时,它直接解决了可靠性权衡问题,幻觉率从 25% 以上下降到 4.5%。