论文
通过隐藏状态的相对表示进行大语言模型中基于参考的偏差检测
Reference-Based Bias Detection in LLMs via Relative Representations of Hidden States
摘要
现有的偏差审计方法通常依赖于模型输出,需要昂贵的基准或判断模型,并且可能会丢失从未出现在生成文本中的内部变化。我们提出了一种基于参考的方法,该方法可以审核相关模型变体中隐藏状态表示的偏差,例如微调之前和之后。由于微调重塑了表示几何形状,因此绝对隐藏状态不可直接比较,因此我们根据每个句子与一组固定锚句子的相似性对其进行编码,从而在共享比较空间中产生相对表示。在那里,我们测量目标群体与积极和消极属性的关联如何变化,我们将这个量称为表征偏差变化 $\Delta B$。在三个模型系列以及 WildGuardMix、DecodingTrust 和 ToxiGen 基准中,$\Delta B$ 与我们测试的 18 个设置中的 15 个设置中的输出水平偏差变化相关,达到 $|r| = 0.84$ ($p < 0.001$) 在完全微调下并且在参数高效适应下变得更加依赖于模型。阈值 $\Delta B$ 检测到其偏差随着 ROC AUC 在 $0.65$ 到 $0.99$ 之间增加的检查点,并且在 WildGuardMix 和 DecodingTrust 上,它比所有三个系列的基于 SEAT 的基线更好地将它们分开。 $\Delta B$ 在锚集、属性集和目标模板发生变化的情况下也保持稳定。我们的方法不需要特定于任务的评估数据,并在大约三分钟内审核模型,使用的计算量比此处考虑的输出级基准少 3$-$50\times$。我们认为它是对基于产出的审计的补充,而不是替代。