论文

自动语音识别公平性的负责任基准测试

Responsible Benchmarking of Fairness for Automatic Speech Recognition

模型评测鲁棒性、公平性与可信度评测

摘要

许多研究表明,自动语音处理 (ASR) 系统在不同说话者组 (SG) 之间的性能并不相同。然而,此类研究得出这一结论的方式并不一致。为了为未来的研究获得更可靠的结果铺平道路,我们根据机器学习公平性、社会科学和语音科学的文献,提出了 ASR 公平性基准测试的最佳实践。我们首先描述了精确询问公平性假设的重要性,并定制公平性指标以专门应用于所述假设。然后,我们检查用于评估 ASR 系统公平性的几个基准,并讨论如果没有对 SG 之间的交叉点进行严格监督,它们的结果如何可能被误解。我们发现,基于单个异构 SG(例如在公平性基准中定义的SG)来评估公平性可能会导致错误地识别哪些 SG 实际上受到 ASR 系统的不当对待。我们主张对公平语料库元数据中可用的尽可能多的人口统计变量的交叉性进行尽可能细粒度的分析,以便梳理出这种虚假的相关性