论文
GIVE-KWS:按音频可靠性门控视觉证据的示例关键词识别
GIVE-KWS: Gated Injection of Visual Evidence for Noise-Robust Query-by-Example Keyword Spotting
摘要
视觉语音有望实现抗噪声的关键词识别,但不一定使用视觉流。在三模态示例查询关键字识别 (QbyE-KWS) 基准测试中,我们发现具有经过任务训练的视觉编码器的系统在 -10 dB 的等错误率 (EER) 方面与文本和音频系统的差距在 2 个百分点以内,并将这一差距与编码器缺乏音素信息联系起来。我们提出了 GIVE-KWS,其融合阶段 GIVE(视觉证据的门控注入)通过门控交叉注意力条件查询嘴唇运动的音频。我们表明,视觉鲁棒性取决于两个相互作用的条件:带有音素的视觉表示,以及注入视觉证据而不是重新缩放音频特征的融合。在带有音素的编码器下,注入可比 -10 dB 的掩蔽产生 4.0-9.3 dB 的有效 SNR 增益,而在音素较差的编码器下,它几乎消失。相对于基准系统,GIVE-KWS 在 -10 dB 时将未见关键字 EER 降低了 72.9%,平均降低了 62.8%。