论文

当纠缠下限差异时:审计和修复音频理解模型中的人口统计公平性

When Entanglement Lower-Bounds Disparity: Auditing and Repairing Demographic Fairness in Audio Understanding Models

模型评测鲁棒性、公平性与可信度评测

摘要

语音技术会对某些声音造成不利影响:黑人说话者的识别错误率几乎是黑人说话者的两倍,而第二语言口音和年龄较大的说话者的识别准确度会下降。我们引入了 TRIAD,这是一个审核网格,涵盖 120 个文本、24 个渲染的人口统计语音配置文件(性别、年龄段、口音)以及通过可控文本到语音的 10 种表达风格,将感知到的人口统计属性与内容和影响隔离开来。对于十个开放权重编码器,我们定义了轴保真度函数、轴子空间之间的主角泄漏和组条件间隙;一个命题证明平均探测差异随着我们测量的相同的总语音语义泄漏$\Lambda$而增长,并且推论表明峰值泄漏迫使活动区域内出现最坏情况的差异。测量的均方探针差异跟踪 $\Lambda$ (Pearson r = 0.93),并且黑盒协议在两个闭源模型中公开相同的签名。 ORCA 是一种结合了特定轴对比头、正交性惩罚和组平衡采样的适配器,可将泄漏减少 72%,并将间隙大致减半。