论文
为何难以与专家判断对齐:主观评测的证据
Why Expert Alignment Is Hard: Evidence from Subjective Evaluation
摘要
在主观评估任务中,使 大语言模型 与专家判断保持一致尤其困难,因为专家可能会不同意,依赖默认标准,并随着时间的推移改变他们的判断。在本文中,我们研究专家对齐作为理解这一困难的一种方式。通过专家评估和后续调查问卷,我们研究了不同形式的专家信息如何影响一致性以及这揭示了主观判断的内容。我们的研究结果显示了四种一致的模式。首先,不同专家的对齐难度差异很大,这表明专家的评估风格与模型先前行为的距离存在很大差异。其次,明确的标准和推理并不总能改善一致性,这表明专家的判断并没有完全被语言化的规则所体现。第三,编辑对示例的数量和身份都很敏感,少量的编辑可以提供有用但不稳定的收益。第四,不同评估维度的对齐难度不同:更直接地基于提案内容的维度更容易对齐,而需要外部知识或基于价值判断的维度仍然更难。总而言之,这些结果表明,专家对齐是困难的,不仅因为模型的局限性,还因为主观评估本质上是异质的、部分隐性的、维度依赖的和时间上不稳定的。