论文

公平的输出、有偏的内部:高风险决策中大语言模型潜在偏见的因果效力与不对称性

Fair outputs, Biased Internals: Causal Potency and Asymmetry of Latent Bias in LLMs for High-Stakes Decisions

模型评测鲁棒性、公平性与可信度评测

摘要

经指令微调的语言模型在高风险决策中表现出行为层面的公平,但其内部表示中仍保留有偏的关联。然而,这些被压制的表示能否影响模型输出,以及这种因果效力在人口群体之间是否对称,仍属未知。我们利用仅在种族相关姓名上不同的配对申请,研究开放权重模型在抵押贷款核保中的使用,揭示出一个关键断层:模型在输出层面没有偏见,却在各模型层中保留并放大人口属性表示。通过激活引导与新颖的跨层干预,我们证明这些被压制的信息与决策相关:在关键层重新注入时,会产生接近完全的决策翻转。关键的是,这种潜在偏见是不对称的——引导干预在一个人口方向上影响决策,而在相反方向上几乎无效——并且易受对抗性提示工程与参数高效微调的影响。这些发现表明,仅关注输出的行为审计并不充分:公平的输出可能掩盖可被利用的内部偏见。它们也推动了将输出评估与表示分析相结合的双层测试框架,用于高风险决策中的AI治理。

公平的输出、有偏的内部:高风险决策中大语言模型潜在偏见的因果效力与不对称性:论文配图
图1:按信用分组的批准率:(a)平均批准率;(b)与种族交互后的批准率,揭示输出公平内部分歧。