论文

通过语义感知偏差估计测量大型音频语言模型的公平性

Measuring Fairness in Large Audio Language Models via Semantic-Aware Bias Estimation

模型评测评测方法与指标

摘要

大型音频语言模型 (LALM) 在语音识别和音频问答等音频理解任务中的使用越来越多,引发了对跨人口群体公平性的担忧。由于混杂因素,包括口语内容的语义变化和特定于说话者的特征,口语输入设置中的公平性评估具有挑战性。忽略这些因素可能会导致关于模型偏差的误导性结论。我们提出了一种语义感知的混合效应回归框架,用于 LALM 中的公平性评估,明确解释了这些混杂因素。我们的方法将参考文本的句子级语义嵌入作为协变量,并将说话者身份建模为随机效应。值得注意的是,语义表示是从评估中的同一 LALM 中提取的,从而能够对模型本身感知的变化进行语义控制。对模拟数据和现实世界基准的实验表明,所提出的方法大大减少了虚假公平性发现,并产生了对子组绩效差异更稳健和可解释的估计。