论文

LLM 潜在去偏方向可能捕获置信度而非公平性

Latent space bias directions in LLMs capture confidence, not fairness

模型评测模型行为与机制分析

摘要

激活转向作为大语言模型的轻量级推理时去偏技术而广受欢迎。然而,之前的工作报告称,引导向量的泛化能力很差,会对模型性能产生意想不到的影响,并且限制了向新数据集的传输。我们的工作分析了用于激活转向的去偏方向实际编码的内容,以揭示其不一致的性能。我们研究通过对比反偏见和偏见提示的激活获得的线性去偏见方向,并将其评估为跨偏见和常识基准的转向干预。我们发现这个方向由模型置信度主导,从激活空间中的高概率区域到低概率区域 token,而不是编码模型偏差的有意义的表示。沿着它进行引导确实会减少测量偏差,但这是降低模型置信度的结果:在 QA 基准上,我们发现这种引导会导致模型放弃回答,从而产生改进 公平性 指标的副作用。我们的实验表明,模型置信度是隐藏空间中有偏提示和反偏提示之间的主要分离因素,这表明从模型置信度中分离出偏差的线性表示是很困难的,并且应该谨慎解释基于转向的去偏结果。简而言之,转向似乎可以减少偏差,不是通过纠正模型的潜在偏好,而是通过降低模型的信心,即使是在与偏差无关的任务上。

LLM 潜在去偏方向可能捕获置信度而非公平性:论文原图
图 1. 针对 Llama-3.1-8B-Instruct 的论文两个核心主张的说明。左:线性分类器偏差分数 $P(\mathrm{biased})$ 的分布,在模糊的 BBQ 上下文中进行训练,在 BBQ 消除歧义的上下文中进行评估,并标记为有偏差(粉色)或反偏差(青色)答案类型。线性分类器很难区分有偏提示和反偏提示,AUROC 仅 0.57。中图:与左图相同,但标记为评分答案是模型的最高(紫色)还是最低(绿色)概率选择。该分类器在置信度上实现了比在偏差上更高的可分离性,AUROC 为 0.94。右:BBQ(模糊)上分配给偏向(粉红色)、反偏向(青色)和中性/弃权(灰色)答案的平均概率,作为沿着去偏方向的激活转向强度 $\alpha$ 的函数。转向增加了弃权率,而不是纠正潜在的偏见/反偏见偏好,这与由信心而不是偏见主导的方向一致。Bias-探针 分数按信心划分远好于按偏见类别划分;转向增加了弃权。三面板图。左:探针 对 BBQ 消歧问题的有偏见与无偏见答案的偏见得分直方图 - 两个分布几乎完全重叠(AUROC 0.57)。中:相同的分数根据答案是模型的最高概率选择还是最低概率选择而划分 - 分布几乎完全分离(AUROC 0.94)。右:从 $-1$ 到 $2$,针对偏向、反偏向和中性(弃权)答案的转向强度 $\alpha$ 的平均答案概率 - 偏向和反偏向曲线从约 0.5 一起下降到 0.2,而中性曲线从接近 0 上升到约 0.65 并占据主导地位。