论文
Judge Reliability Harness:对LLM裁判可靠性进行压力测试
Judge Reliability Harness: Stress Testing the Reliability of LLM Judges
摘要
我们推出Judge Reliability Harness,一个用于构建验证套件以测试LLM裁判可靠性的开源库。随着基于LLM的评分在AI基准中广泛部署,需要更多工具来高效评估这些方法的可靠性。给定基准数据集和LLM裁判配置,该工具生成可靠性测试,评估二元判断准确率和自由回答及Agentic任务格式下的序数评分表现。我们在覆盖安全、说服、滥用和Agentic行为的四个基准上评估四个最先进的裁判,发现不同模型和扰动类型之间的性能存在显著差异,凸显了改进LLM裁判鲁棒性的机会。用我们的工具评估的裁判没有一个能在所有基准上保持一致的可靠性。例如,我们的初步实验表明,裁判在评判另一个LLM完成任务的能力时存在一致性问题,原因仅是简单的文本格式更改、改写、冗长度变化以及翻转LLM生成回答中的真值标签。该工具代码见https://github.com/RANDCorporation/judge-reliability-harness。
