论文
JudgeArena:可重复 LLM-Judge 评估的统一框架
JudgeArena: A Unified Framework for Reproducible LLM-Judge Evaluation
摘要
LLM 作为法官评估已成为对语言模型进行排名的主导范例,但生态系统仍然支离破碎:大多数基准测试都有自己的代码库,对特定的封闭模型法官进行硬编码,并支持单一评估协议。这种碎片化使得研究设计选择(基准、判断模型、提示、推理后端)如何影响我们得出的关于模型质量的结论变得困难。我们推出 JudgeArena,这是一个开源框架,它将主要的 LLM 法官基准(AlpacaEval、Arena-Hard、MT-Bench 和 m-Arena-Hard)统一在一个界面下,具有可交换的法官和全面的元数据日志记录,以提高报告和可重复性的透明度。它可以对法官选择进行系统研究,因为任何可通过 vLLM、llama.cpp 或 OpenRouter 访问的模型都可以充当候选人和法官。此外,JudgeArena 还为开放模型提供了经过调整的法官配置,这些配置可匹配或优于封闭模型法官,并在英语和多语言环境中的人类偏好数据集上进行验证,从而减少对不透明封闭模型的依赖。最后,通过将现有的人类注释与目标模型的 LLM 法官评估相结合,JudgeArena 可以高精度模拟 LMArena Elo 分数,为大规模人类注释活动提供实用、开放且低成本的替代方案。