论文
基于课程的视觉语音识别中音素到文本重建的噪声适应
Curriculum-Based Noise Adaptation for Phoneme-to-Text Reconstruction in Visual Speech Recognition
摘要
以音素为中心的视觉语音识别根据中间音素预测重建句子,使得整体识别性能高度依赖于音素到文本重建模型的鲁棒性。现有的重建方法通常是在干净的音素序列或综合损坏的输入上进行训练,导致训练条件与推理过程中遇到的实际音素预测错误之间不匹配。为了解决这一局限性,本文提出了渐进式错误课程训练(PECT)。该课程学习框架使用合成音素扰动、多域伪标签和由视觉语音识别器生成的目标域伪标签,逐步采用基于不留语言 (NLLB) 的音素到文本重建模型。通过逐渐将重建模型暴露于日益现实的音素预测误差中,所提出的框架提高了鲁棒性,同时保持了句子重建的准确性。 LRS2 和 LRS3 基准测试表明,PECT 持续改进了多个基于音素的视觉语音识别前端的重建性能,包括视觉自动语音识别 (V-ASR)、点视觉自动语音识别 (PV-ASR) 和头部姿势感知视觉语音识别 (HP-VSR) 变体。特别是,PECT 在 LRS2 上将 HP-VSR-FiLMFuse (L4) 的字错误率 (WER) 从 23.3% 降低到 22.2%,在 LRS3 上将 HP-VSR-ResFiLM 的 WER 从 30.3% 降低到 29.7%。全面的消融研究和定性分析进一步证明了逐步使重建模型适应实际音素预测误差的有效性。这些结果表明,PECT 为以音素为中心的视觉语音识别中的音素到文本重建提供了一种有效且可推广的课程学习策略。