论文
LRS-VoxMM:野外视听语音识别的基准
LRS-VoxMM: A benchmark for in-the-wild audio-visual speech recognition
摘要
我们推出 LRS-VoxMM,这是一种视听语音识别 (AVSR) 的野外基准。该基准源自 VoxMM,这是一个包含人工注释转录的各种现实世界口语对话的数据集。我们选择适合 AVSR 的样本,并以 LRS 样式格式对其进行预处理,以便直接在现有 AVSR 管道中使用。与常用基准相比,LRS-VoxMM 涵盖了更多样化的场景和声学条件。我们还发布了具有附加噪声、混响和带宽限制的失真评估集,以支持严重声学退化下的评估。实验结果表明,LRS-VoxMM 比 LRS3 难得多,并且随着音频信号的退化,视觉信息的贡献变得更加明显。 LRS-VoxMM 支持更现实的 AVSR 基准测试,并鼓励进一步研究视觉信息在具有挑战性的现实条件中的作用。