论文
作为长形式输出评估的法官对 LLM 进行基准测试
Benchmarking LLM-as-a-Judge for Long-Form Output Evaluation
摘要
随着 大语言模型 (LLM) 越来越多地用于长格式生成,可靠地评估长格式输出已成为一项关键挑战。 LLM-as-a-judge 提供了人类评估的可扩展替代方案,但其在长格式输出评估中的可靠性仍未得到充分检验:现有的元评估基准主要关注短格式输出。与短式评估相比,长式评估不仅仅是输出长度的问题;它通常要求法官对整体组织、与任务相关的覆盖范围和深度、跨部门一致性以及特定场景的质量标准进行更复杂的文件级评估。在这项工作中,我们引入了 LongJudgeBench,这是一个综合基准,用于评估 LLM 法官在不同现实场景和评审协议中的长格式输出。我们系统地评估了广泛的 LLM 裁判,涵盖多种基本模型和评审设置。我们的结果揭示了巨大的可靠性差距:当前的 LLM 法官在不同场景中仍然不稳定,并且标题或参考文献是有帮助的,但并不总是足够的。我们希望 LongJudgeBench 将支持未来对更强大、上下文感知和人性化的 LLM-as-a-judge 方法的研究。我们的代码可在 https://github.com/cjj826/LongJudgeBench 获取。