论文
鲁棒视听语音识别中对比解码的注意力引导可靠性缩放
Attention-Guided Reliability Scaling for Contrastive Decoding in Robust Audio-Visual Speech Recognition
摘要
基于 大语言模型 (LLM) 的视听语音识别 (AVSR) 系统在噪声下具有鲁棒性。对比解码 (CD) 最初是为了通过在推理时将较弱的模型与较强的模型进行对比来稳定 LLM 的生成而引入的,无需额外的训练即可调整预测。在这项工作中,我们通过在同一底层模型中对比纯音频调节和完整视听调节,将 CD 应用于 AVSR。然而,使用固定的对比强度会在噪声水平之间进行权衡:更强的干预有助于在严重噪声下进行,但在清洁条件下可能会过度校正可靠的预测。我们建议对 AVSR 进行可靠性感知的 CD 扩展。我们没有使用固定的强度,而是根据从注意力动态和模型间预测分歧中得出的可靠性信号自适应地调节每个标记的对比影响。 LRS3 的实验表明,在干净和低 SNR 条件下都有一致的改进。