论文

Judge Reliability Harness:对LLM裁判可靠性进行压力测试

Judge Reliability Harness: Stress Testing the Reliability of LLM Judges

模型评测评测方法与指标

摘要

我们推出Judge Reliability Harness,一个用于构建验证套件以测试LLM裁判可靠性的开源库。随着基于LLM的评分在AI基准中广泛部署,需要更多工具来高效评估这些方法的可靠性。给定基准数据集和LLM裁判配置,该工具生成可靠性测试,评估二元判断准确率和自由回答及Agentic任务格式下的序数评分表现。我们在覆盖安全、说服、滥用和Agentic行为的四个基准上评估四个最先进的裁判,发现不同模型和扰动类型之间的性能存在显著差异,凸显了改进LLM裁判鲁棒性的机会。用我们的工具评估的裁判没有一个能在所有基准上保持一致的可靠性。例如,我们的初步实验表明,裁判在评判另一个LLM完成任务的能力时存在一致性问题,原因仅是简单的文本格式更改、改写、冗长度变化以及翻转LLM生成回答中的真值标签。该工具代码见https://github.com/RANDCorporation/judge-reliability-harness。

Judge Reliability Harness:对LLM裁判可靠性进行压力测试
图2:人在环审核用户界面(智能体模式)。基准中的原始样本显示在顶部。左侧显示作为输入提供的对话记录,以及由合成数据流水线所做的以红色和绿色标示的编辑。右侧显示编辑后的对话记录,它是一个自由文本框,用户可用其进行进一步编辑。底部为用户提供选项:若对编辑满意则接受该样本,或拒绝该样本并继续处理下一个。