论文
超越单次运行的公平性:言语 LLM 适应中的训练种子变异性
Fairness Beyond a Single Run: Training-Seed Variability in Speech LLM Adaptation
摘要
自动语音识别中的人口统计公平性差距几乎总是从单次训练中报告出来。我们以五个音频压缩因子和六个随机种子对语音 LLM 的 Q-former 投影器和 LoRA 适配器进行微调,保持编码器、基本解码器、数据和解码固定,并评估 Common Voice 和 Fair-Speech 上的每次运行。在 460 小时的干净 LibriSpeech 中,种子在大多数人口统计轴上对公平性指标的影响比压缩更大。平衡的 3x3 分解将Fair-Speech种族归一化差异的 85.3% 归因于种子,而 8.3% 归因于压缩 (p = 0.009),尽管压缩更多地解释了年龄和性别。 Held-out LibriSpeech 单词错误率在这些种子中波动了 0.04 个点,而 Common Voice 则波动了 8.57 个点,因此这些不是失败的运行,并且在控制准确率和dropout后效果仍然存在。将适应设置为 960 小时进行缩放和多样化会减弱效果,但不会消除它。在Fair-Speech种族方面,两个单次运行系统的标准化差距必须相差超过 0.30,才能超过种子变异性。