论文
唇读差距:VSR 模型是否能像人类唇读师一样感知视觉语音?
The Lipreading Gap: Do VSR Models Perceive Visual Speech Like Human Lipreaders?
摘要
视觉语音识别(VSR)模型现在在基准上超越了人类唇读器,但这样的进步是否能够建立类似人类的视觉语音感知?为了探索这一点,我们使用单词、字符、音素和视素级指标,在 MaFI 单词级唇读数据集上将三个 VSR 系统与人类基线进行比较。尽管模型总体准确率更高,但它们的成功和失败与人类不同。仅给出几个初始音素的纯文本 n-gram 基线可与人类唇读相媲美。 VSR 单词级错误始终可以通过训练词频比通过单词的视觉信息量来更好地解释。视位准确度、混淆矩阵和人类模型相关性进一步表明,模型在人类最难发现的视位上获益最多,并且对视觉清晰度的依赖性要弱得多。我们的工作表明,VSR 系统主要依赖于训练数据中的语言线索,而不是视觉感知,无法将视觉特征绑定到有意义的单词中。