论文
基于 LLM 的视听语音识别的最佳传输语义对齐
Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition
摘要
基于 大语言模型 (LLM) 的视听语音识别 (LLM-AVSR) 最近通过利用互补的音频和视觉信息,在不利的声学环境中表现出了强大的鲁棒性。现有方法通常采用独立预训练的声学和视觉编码器,其输出被投影并融合为软提示,以调节 LLM 进行语音识别。然而,大多数方法在执行多模态融合时没有明确解决音频、视觉和文本模态之间的表征差异,这可能限制了跨模态集成的有效性。在本文中,我们为 LLM-AVSR 提出了一种基于最佳传输(OT)的语义对齐框架。所提出的方法通过在多模态融合之前参考 LLM 的语言嵌入空间对齐声学和视觉表示,明确地弥合了模态差距。具体来说,OT 用于估计概率耦合矩阵,该矩阵表征模态特定特征和语言嵌入之间的结构化对应关系。由此产生的 OT 耦合被进一步用作软伪标签来监督对比学习,鼓励提取语义连贯和跨模式一致的视听表示。通过将多模态特征锚定到 LLM 的语言空间,所提出的框架有助于更有效的多模态融合和解码。我们使用基于 Whisper 的声学编码器、基于 AV-HuBERT 的视觉编码器和 LLaMA3.2-3B 解码器来实现所提出的框架。在 LRS3-TED 基准测试上进行的实验表明,在各种信噪比 (SNR) 范围内,在干净和嘈杂的评估条件下,均比强基线有了持续改进,并实现了最先进的性能。