论文

VIB-AVSR:基于噪声鲁棒 LLM 的视听语音识别的变分信息瓶颈

VIB-AVSR: Variational Information Bottleneck for Noise-Robust LLM-Based Audio-Visual Speech Recognition

模型架构新型架构

摘要

视听语音识别采用两种输入模式:声学和视觉流,其中来自嘴唇运动的视觉信息有助于在音频嘈杂时进行识别。最近,基于 LLM 的 AVSR 模型通过将预先训练的视听编码器连接到 LLM 成为一种有前途的范例,在干净的条件下取得了良好的结果。然而,这些模型主要针对干净的声学条件进行了优化,而很少关注使 LLM 主干网对噪声具有鲁棒性。没有采用明确的机制来在损坏的音频下产生稳定的表示,从而导致噪声环境中的性能下降。为了解决这个问题,我们提出了 VIB-AVSR,它在 LLM 主干内的目标位置集成了变分信息瓶颈层,以规范表示。 VIB-AVSR 可减少多个 SNR 级别和噪声类型的噪声条件下的性能下降,而无需修改架构或额外的训练数据。