论文
JudgeProfile:理解和引导大语言模型评审的主观性
JudgeProfile: Understanding and Steering Subjectivity in LLM Judges
摘要
LLM 评审本质上是主观的,当两个选项客观上都没有错误时,他们通常会在成对比较中倾向于不同的反应。为了研究这种主观性,我们引入了 JudgeProfile,这是一个框架,它将 LLM 评估剖析为感知(评审如何比较清晰度、正确性和细节等特定属性的两个回答)和优先级(每个属性对最终选择的影响程度)。我们策划了SubjectiveSet,这是一个包含来自 17 个公共数据源的 50,013 个响应对的数据集,由 21 位大语言模型评审针对 87 个属性进行评估。我们在感知中发现了一个隐藏的共识:即使评审的整体选择存在分歧,他们也经常在属性判断上达成一致。在此分离的基础上,我们首先使用根据自己的总体选择估计的属性权重来描述每个评审的优先级。即使根据相同的属性判断进行估计,这些权重也会因判断而异。然后,我们从参考标签中学习新的权重,以使他们的决策适应目标评估标准。重新加权感知属性将与参考标签的平均保留一致性从 66.48% 提高到 71.97%,优于微调和标题提示。我们的研究结果表明,理解和引导大语言模型评审的主观性不仅需要关注他们的感知,还需要关注他们如何优先考虑它们。