论文

LLM 法官系统中的锚定偏差:先前的分数损害了评估的独立性

Anchoring Bias in LLM-as-a-Judge Systems: Prior Scores Compromise Evaluation Independence

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 越来越多地评估生成的内容,从而产生了 LLM 作为法官的范式。这些系统现在对生产管道中的输出、过滤内容和门迭代细化进行评分,其中每个判断通常被假设为独立于早期评估。我们使用三个提示条件来测试这个假设:无元数据、修订框架以及包含修订、尝试和先前分数字段的锚定元数据。我们展示了先前的分数,即使仅作为上下文元数据包含在内,也可以锚定判断并系统地将评级转向其值。在 192,000 次尝试评估中(185,271 次成功),对于 20 个固定文本的总锚定元数据效应,八个评估模型中有 7 个的 95% 任务分层引导区间低于零。 Cohen 的 $d$ 是分数分布之间差异的标准化度量,其绝对值达到 0.71。对所选模型任务探针的 词元级 分析表明了一种类似阈值的响应模式:引入锚定元数据会产生输出分数概率的显着重新分布,而在测试的低于阈值范围内改变锚定值会产生相对较小的额外变化。在带有人工标记 真值 的分类行业数据上,锚定元数据阻止了 48% 的错误更正,并将 10.18% 的正确判断转向分配的错误标签,这表明偏差超出了数字评分,延伸到了分类决策。尽管警告相对于行业实验中的基线提高了配对准确性效果,但思想链和元数据忽略警告都不会降低总体效果。可靠的 LLM 评估需要仔细的上下文工程,而不是公正的假设。必须针对预期模型和任务或域验证有效的缓解措施。