论文

VisG AV-HuBERT:嘴型引导 AV-HuBERT

VisG AV-HuBERT: Viseme-Guided AV-HuBERT

模型训练监督微调与指令调优

摘要

如今,视听语音识别 (AVSR) 系统将 大语言模型 (LLM) 解码器与基于 Transformer 的编码器集成,实现了最先进的结果。然而,改进的语言建模与增强的视听编码的相对贡献仍不清楚。我们提出了视位引导 AV-HuBERT (VisG AV-HuBERT),这是一种多任务 微调 框架,它结合了辅助视位分类,以加强模型对视觉发音特征的依赖。通过使用轻量级视位预测子网络扩展 AV-HuBERT,该方法明确指导编码器保留视觉语音信息。在 LRS3 上进行评估,VisG AV-HuBERT 与基线 AV-HuBERT 相比,实现了可比或改进的性能,并且在重噪声条件下具有显着的增益。对于语音噪声,在 -10 dB 信噪比 (SNR) 下,WER 从 13.59% 降低至 6.60%(相对改进 51.4%)。更深入的分析表明,各种噪声类型的替换错误大幅减少,从而证明了语音单元辨别力的改善。对 LRS2 的评估证实了泛化能力。我们的结果表明,显式视位建模增强了编码器表示,并为通过编码器级改进增强抗噪声 AVSR 奠定了基础。