论文

您的多模态语音模型表明我有一张适合广播的脸

Your Multimodal Speech Model Says I Have a Face for Radio

模型评测鲁棒性、公平性与可信度评测

摘要

随着大型神经模型在语言任务上变得越来越好,研究人员越来越多地构建处理更多数据模态的多模态和全模态模型。一个例子是将语音识别模型扩展到视听数据,以减轻噪音和多模式字幕。虽然在单一模式体系中对表现和偏见进行了广泛的研究,但尚不清楚新模式如何影响这一点,尽管它们会在人类中产生偏见。因此,我们提出了多模态语音识别的第一个偏差评估,其中我们创建将不同面孔与相同音频配对的视频,并测量语音转录准确性的变化。我们发现 mWhisper-Flamingo 和 Gemini 模型的服务质量存在巨大差异,在自我声明的性别、种族及其交叉点上,单词错误率下降了高达 4.05 个点。我们的研究结果表明,开发人员应优先评估、修复和沟通此类限制,因为通过额外方式提供更多信号并不一定更好,甚至可能导致有偏差的结果。