论文
LLM评审器能可靠核验Agent任务的评分标准吗?
Can LLM-as-a-Judge Reliably Verify Rubrics in Agentic Scenarios?
摘要
按评分标准条目评价模型输出已被广泛使用,通常由LLM评审器执行,但长且复杂的Agent输出使可靠性更加重要。研究提出RuVerBench,覆盖深度研究与Agent编码两个领域的2,458个实例,每项含模型输出、评分标准及输出是否满足标准的人工标签。前沿LLM虽表现较强,仍有明显噪声。论文进一步比较提示设计、批处理与多数投票:较弱模型更受提示变化影响;批量核验在准确性与效率间取舍;多数投票有效但边际收益递减。数据集与代码公开于https://github.com/THU-KEG/RuVerBench。