论文
迈向更高效的金融语言模型偏差检测
Towards a more efficient bias detection in financial language models
摘要
金融语言模型中的偏差是其落地真实应用的一大障碍。检测此类偏差具有挑战性,因为它需要识别出那些在改变与决策无关的属性(如人口统计属性)时预测会发生变化的输入。现有方法通常依赖在大语料上进行穷举式变异与成对预测分析,虽然有效但计算代价高昂——对大语言模型尤其如此——并且在持续重训练与发布流程中可能变得不切实际。为降低这一成本,我们对五个金融语言模型开展了大规模偏差研究,考察其在各受保护属性上偏差倾向的相似性,并探索跨模型引导的偏差检测,以更早地发现暴露偏差的输入。我们的研究使用约17k条真实金融新闻句子,通过变异构建了超过125k个原始-变异句对。结果表明,所有模型在原子(0.58%–6.05%)与交叉(0.75%–5.97%)两种设置下均表现出偏差。此外,我们观察到暴露偏差的输入在各模型间存在一致模式,使得偏差检测能够实现大幅复用与成本降低。例如,在由DistilRoBERTa输出导出的属性引导下,仅使用20%的输入对即可发现FinMA多达73%的偏差行为。