论文

用分布匹配的新测试集检验视听语音识别泛化

Assessing True Generalisability of Audio-Visual Speech Recognisers

模型评测基准与评测资源

摘要

当前的视听语音识别 (AVSR) 模型在标准 LRS3 基准上实现了近乎完美的性能,引发了自适应过度拟合的担忧。为了系统地评估真正的泛化能力,我们构建了一个高度受控的、看不见的评估集,该评估集是从大量 MultiVSR 数据集中二次采样的。与标准的分布外基准不同,我们的子集严格匹配 LRS3 测试集的声学、视觉和人口统计分布。评估五种最先进的架构揭示了普遍的性能崩溃,证明当前的系统即使在严格一致的条件下也无法泛化。通过对七个因素的细粒度属性分析,我们隔离了这种退化的具体驱动因素。此外,我们发现了深刻的词汇偏差,暴露了明显的错误模式,并令人惊讶地发现视听性能甚至落后于纯音频设置。我们发布了匹配的测试集以供未来的基准测试。