论文
不公平法官的内部:LLM 作为法官偏见的机械可解释性解释
Inside the Unfair Judge: A Mechanistic Interpretability Account of LLM-as-Judge Bias
摘要
现有的 LLM 作为法官评分偏差的研究主要在输入输出层面进行:它们扰乱输入,测量分数增量,并提出即时级别的缓解措施。我们认为,同样的偏见承认法官隐藏状态中的表征水平帐户,与输入输出视图相补充,并且在操作上有用,但它无法提供。我们报告了针对七名法官、七种偏见类型和九个基准的三项调查结果。几何:基线判断输入占据一个紧密的激活流形,而有偏差的输入沿着低维、特定类型的子空间移位,该子空间随着深度而锐化,并由三个估计器系列一致地恢复。因果控制:沿该子空间控制隐藏状态可在两个方向上驱动评分,前向移位在干净输入上再现有偏差的评分,反向移位在有偏差的输入上恢复基线评分,而匹配范数随机方向产生的移位要小一个数量级。可操作:对相同偏差方向特征的简单线性投影可以预测在三个完全看不见的基准上的判断失败,大大优于基于文本的替代方案。将偏差解读为激活几何,而不是输入输出噪声,将几何结构、因果控制和操作预测统一在一个框架内。项目页面位于 https://xzx34.github.io/unfair-judge/