论文
当一致性并不意味着可靠性时:根据人类评级评估当地大语言模型法官
When Consistency Does Not Mean Reliability: Evaluating Local LLM Judges Against Human Ratings
摘要
大型语言模型 (LLM) 越来越多地用于评估其他语言模型的响应。这种方法被称为大语言模型作为法官,比人工评估更快、更便宜。然而,法官可能会给出一致的分数,但不一定与人类评估者一致。在这项工作中,我们使用两位本地开放权重 LLM 法官 LLaMA-3-8B 和 Qwen2.5-7B 来研究这个问题。我们评估了由指令调整的 GPT-2 (124M) 模型生成的 300 个回答,涉及 100 个问题,涵盖五个类别:事实知识、指令遵循、数学、推理和写作。每个回答均由九名人工注释者评分,并由每位大语言模型法官使用相同的评分标准评估三次。我们使用 Pearson 相关性、Spearman 相关性、平均绝对误差 (MAE)、符号偏差和自我一致性将评判分数与人类平均分数进行比较。 LLaMA-3-8B 显示与人类评分的皮尔逊相关性为 0.275,而 Qwen2.5-7B 达到 0.340。它们的 MAE 分别为 27.71 和 18.64。尽管一致性有限,两位评委都表现出了很高的自我一致性,LLaMA-3-8B 的精确一致性率为 97.3%,Qwen2.5-7B 的精确一致性率为 92.3%。这些结果表明,高度的自我一致性并不一定表明与人类判断高度一致。我们的研究结果强调,在使用本地大语言模型作为自动法官时,需要评估一致性和人类一致性。