论文
当AVSR遇上视频会议:数据集、降级以及性能崩溃背后的隐藏机制
When AVSR Meets Video Conferencing: Dataset, Degradation, and the Hidden Mechanism Behind Performance Collapse
摘要
视听语音识别 (AVSR) 在离线条件下取得了显着的进步,但其在现实世界视频会议 (VC) 中的稳健性在很大程度上仍未得到探索。本文首次对主流 VC 平台上最先进的 AVSR 模型进行了系统评估,揭示了传输失真和人类自发过度表达导致的严重性能下降。为了解决这一差距,我们构建了 \textbf{MLD-VC},这是第一个为 VC 量身定制的多模态数据集,包含 31 位说话者、22.79 小时的视听数据,并明确使用伦巴第效应来增强人类超表达。通过综合分析,我们发现语音增强算法是分布偏移的主要来源,它改变了音频的第一和第二共振峰。有趣的是,我们发现伦巴第效应引起的分布变化与语音增强引入的分布变化非常相似,这解释了为什么在伦巴第数据上训练的模型在 VC 中表现出更大的鲁棒性。 MLD-VC 上的 微调 AVSR 模型缓解了这一问题,在多个 VC 平台上实现了 CER 平均降低 17.5%。我们的研究结果和数据集为在现实视频会议中开发更强大和更通用的 AVSR 系统奠定了基础。 MLD-VC 可在 https://huggingface.co/datasets/nccm2p2/MLD-VC 上获取。