论文
LLM 潜在去偏方向可能捕获置信度而非公平性
Latent space bias directions in LLMs capture confidence, not fairness
摘要
激活转向作为大语言模型的轻量级推理时去偏技术而广受欢迎。然而,之前的工作报告称,引导向量的泛化能力很差,会对模型性能产生意想不到的影响,并且限制了向新数据集的传输。我们的工作分析了用于激活转向的去偏方向实际编码的内容,以揭示其不一致的性能。我们研究通过对比反偏见和偏见提示的激活获得的线性去偏见方向,并将其评估为跨偏见和常识基准的转向干预。我们发现这个方向由模型置信度主导,从激活空间中的高概率区域到低概率区域 token,而不是编码模型偏差的有意义的表示。沿着它进行引导确实会减少测量偏差,但这是降低模型置信度的结果:在 QA 基准上,我们发现这种引导会导致模型放弃回答,从而产生改进 公平性 指标的副作用。我们的实验表明,模型置信度是隐藏空间中有偏提示和反偏提示之间的主要分离因素,这表明从模型置信度中分离出偏差的线性表示是很困难的,并且应该谨慎解释基于转向的去偏结果。简而言之,转向似乎可以减少偏差,不是通过纠正模型的潜在偏好,而是通过降低模型的信心,即使是在与偏差无关的任务上。
