论文
AgentJudgeBench:评估LLM裁判在Agentic工具调用上的多难度基准
AgentJudgeBench: A Multi-Difficulty Benchmark for Evaluating LLM Judges on Agentic Tool-Calling
摘要
LLM裁判被广泛用于评估agentic工具调用系统,但它们在结构化、依赖驱动工作流上的可靠性基本未被检验。我们提出AgentJudgeBench,首个系统研究LLM-as-a-judge在面向工作流DAG的agentic工具调用上可靠性的基准,区别于更宽泛的开放式文本或偏好评估类LLM-as-a-judge任务。该基准包含3,808个实例,横跨六种DAG拓扑和三个难度层级,在成对的有/无真值条件下,用五个生成器(3B–70B开源权重模型和GPT-5.4)和六个裁判(20B至前沿规模)进行评估。裁判一致性随任务难度单调退化,无真值时退化速度快1.5倍;在无真值的困难查询上,所有六个裁判无论规模大小都收敛到77–82%的狭窄区间,揭示了主要由任务难度驱动、模型容量本身无法突破的结构性上限——尽管其高度对较弱的生成器而言部分取决于提示。真值暴露并非普遍有益:它降低了GPT-5.4(1.5个百分点)和Gemini-2.5-Pro(3.9个百分点)的一致性,与过度锚定效应一致。在缓解策略中,思维链推理和裁判温度的影响都可以忽略,而结构化评估量表最多提升一致性6.5个百分点,但并非在所有裁判-生成器对上一致泛化。有真值时,QwQ-32B最匹配程序化参考,而人类验证研究认定GPT-OSS-120B是与人类对齐度最高的裁判;无真值时,前沿裁判仅在共同上限内略微领先。这些结果揭示了当前LLM裁判的根本局限,并为agentic系统中的可靠评估提供了实用指南。
