论文

DoubleHelix:使用 LLM 进行视听语音识别的结构化跨模态融合

DoubleHelix: Structured Cross-Modal Fusion for Audio-Visual Speech Recognition with LLMs

模型架构递归架构

摘要

视听语音识别(AVSR)依赖于音频和视觉模态的有效融合,但现有方法将跨模态交互视为单步操作,而没有结构化迭代细化。我们提出了 DoubleHelix,一个多模态融合框架,它将融合重新表述为具有自适应退化感知增强功能的迭代跨模态交互过程。该框架由三个组件组成,包括用于具有学习对齐约束的多轮结构化交互的 ReverseParallelHelix、用于学习退化感知门信号的 QualitySensor 以及用于一致性引导条件特征增强的 HelixReplication。 LRS3 上的实验表明,DoubleHelix 在干净音频上实现了 0.68% 的 WER,在匹配主干设置下比之前的最佳结果提高了 5.6%。全面的消融研究验证了每个组成部分的贡献,包括对设计选择(例如不对称通路权重)的针对性分析。该框架在评估的杂音噪声条件下显示出更高的鲁棒性,在 SNR -5dB 下实现了 11.6% 的 WER。