论文

开放LLM评审:恢复最终裁决之外的偏好信号

Opening LLM Judges: Recovering Preference Signals Beyond the Final Verdict

模型评测模型行为与机制分析

摘要

LLM 评审广泛用于评估模型输出,但他们的裁决可能不可靠:评审可能会因为其位置、长度或其他表面特征而倾向于更差的答案。当判断错误时,模型中是否缺少正确判断所需的信息,或者存在于其内部表示中但未反映在输出中?我们在 64 名开放权重评估者和 14 个数据集上进行了研究,包括对 41 名评审的因果干预(在运行中编辑激活以查看判决是否发生变化)。在 LLMBar 上,表面上更好的答案是最差的答案,50 位评审的裁决只有 0.456 的时间与人类标签一致,即使在对两个答案顺序进行平均之后也是如此。然而,在没有权重更新的情况下,对相同评审的激活进行的小型探测达到 0.846,一旦长度和位置等表面特征被残差掉,则达到 0.686(标签打乱后为 0.507)。八个基准和模型系列之间存在差距,但并不普遍:在训练任何探针之前计算表面特征单独预测人类标签的程度的分数,可以预测增益的大小(Spearman rho = 0.90)。在一次只得出一个答案的评分规则任务中,没有留下可供利用的表面线索,阅读内部结构没有任何优势。干预措施还表明,在可以直接读出并定位携带位置和长度偏差的路径之前,编辑网络中的激活已经改变了判决。在相同的标签预算下,恢复的信号可以让评审标记可能错误的情况,并为偏好学习产生更好的标签。因此,错误的判决并不意味着评审缺乏信息,简单的诊断即可显示何时值得恢复。