论文
InterCorrect:交叉人口群组感知的 ASR 模型合并
InterCorrect: Intersection-Aware Correction of Demographic Model Merging for Fair ASR
摘要
自动语音识别 (ASR) 系统通常在不同人口群体中表现出参差不齐的性能,并且对于属于多个人口群体的说话者来说,错误尤其难以解决。这项工作研究基于人口统计的模型合并,以实现基于 Speech-LLM 的公平 ASR。从基于 SLAM-ASR 的模型开始,我们仅微调特定于人口统计的子集上的连接器,并将生成的适应子组的连接器合并到全局模型中。然后,我们使用子组 WER 和任务向量冲突来识别关键的跨轴人口统计对,并将特定于交叉点的校正向量应用于全局合并模型。 Fair-Speech 上的实验表明,全局人口统计合并比基本模型提高了整体 WER,而交叉校正为多种合并策略提供了额外的收益。特别是,采用基于 WER 的校正的 TIES 实现了最佳的整体 WER,将其从 7.38\% 降低到 5.13\%。亚组和差异分析进一步表明,所提出的方法提高了跨人口统计轴的表现,同时强调较低的平均 WER 并不总是意味着亚组差异的减少。