论文
“自己的”与“别人的”标签,会双向影响大模型评判
Self- and Other-Labels Induce Bidirectional Bias in LLM Judges
摘要
随着“LLM 作为法官”变得越来越普遍,自我偏好(法官倾向于自己的输出的倾向)引起了人们对评估可靠性的日益担忧。然而,这种偏差主要是在生成的文本上进行研究的,其中文体特征和响应质量不可避免地被混为一谈。因此,现有的测量方法无法将真正的自我偏好与这些混杂因素区分开来。我们通过改变评估对象来解决这个限制:十个 LLM 不判断生成的文本,而是评估从共享池中选择的叙事约束集,这些约束不携带风格指纹,但保留可恢复的特定于模型的签名。关于此任务的两个实验产生了互补的结果。在盲目评估下,自我偏好消失,一旦控制了选择质量和判断严重性,就会在相反方向上留下很小的影响。然而,在匹配的质量下,仅自我标签和其他标签(不命名任何模型)会双向改变分数。无论选择的实际来源如何,LLM 都会判断自标记选择的分数是否较高,而其他标记选择的分数是否较低。我们做出了两个贡献:1)作者归属是评估偏差的明显驱动因素,2)真值-free 任务可以作为研究 LLM 法官行为的受控工具。