论文

可解释的语音情感识别:加权属性公平性对人口统计对社会偏见的贡献进行建模

Explainable Speech Emotion Recognition: Weighted Attribute Fairness to Model Demographic Contributions to Social Bias

模型评测鲁棒性、公平性与可信度评测

摘要

语音情绪识别(SER)系统在心理健康和教育等敏感领域的应用越来越多,在这些领域,有偏见的预测可能会造成伤害。传统的公平性指标,例如均等赔率和人口统计平等,往往忽视人口统计属性和模型预测之间的联合依赖性。我们提出了一种 SER 公平建模方法,通过学习人口统计属性和模型误差之间的联合关系来明确捕获分配偏差。我们在合成数据上验证我们的公平性指标,然后将其应用于评估在 CREMA-D 数据集上微调的 HuBERT 和 WavLM 模型。我们的结果表明,所提出的公平模型捕获了受保护属性和偏差之间的更多相互信息,并量化了基于 SSL 的 SER 模型中各个属性对偏差的绝对贡献。此外,我们的分析揭示了 HuBERT 和 WavLM 中存在性别偏见的迹象。