论文
没有参考答案时,LLM裁判可能给错误回答过高评价
LLM Judges Can Be Too Generous When There Is No Reference Answer
摘要
LLM裁判被用于开放回答评估,常处于没有真实参考答案的环境。本文用两阶段流程检验其可靠性:校准实验评估裁判对所评任务的知识,敏感性实验检查参考答案是否出现及其在提示中的位置如何影响判断。 覆盖三种语言的实验显示,所测裁判在无参考答案时倾向于给错误回答过高评价。部分实验设置中,提示加入参考答案信息后,多达85%的正确/错误判定发生改变。与一部分人工标注比较,这些由参考信息引发的变化总体更接近人类判断。作者建议在无参考环境使用裁判前,先以带参考信息的样本进行校准,并提供可用于其他任务的校准方法。