论文
BabelJudge:跨语言和智能体轨迹测量 LLM 作为法官的可靠性
BabelJudge: Measuring LLM-as-a-Judge Reliability Across Languages and Agent Trajectories
摘要
LLM 作为法官已成为 NLP 流程中可扩展评估的主要方法,但法官本身带有原始准确性隐藏的系统偏差:他们偏向于放置在 A 槽中的响应(位置偏差),无论质量如何,他们更喜欢较长的响应(冗长偏差),并且在资源较低的语言中,其可靠性急剧下降。我们引入了 BabelJudge,一个开源基准和可靠性审计框架,它可以在任何法官模型上测量所有四种失败模式——位置偏差、冗长偏差、顺序不一致和跨语言降级,而不需要人类偏好标签。关键的见解是通过降解进行金标签:从高质量的参考响应开始并应用受控扰动产生一个成对的项目,其金标签通过构造而已知,从而消除了注释成本。我们对英语、印地语、阿拉伯语和斯瓦希里语的 Qwen2.5-7B-Instruct-4bit 进行了评估,发现我们的综合偏差惩罚可靠性得分从印地语的 0.714 下降到斯瓦希里语的 0.550,这一差距被原始准确率(0.835 与 0.660)低估了。斯瓦希里语顺序一致性下降至 0.480,这意味着在槽位顺序交换下法官的判决几乎是随机的——这是一种仅凭准确性无法察觉的故障模式。我们通过九个轨迹级扰动(参数损坏、工具交换、幻觉调用、缺失步骤)和三个新指标进一步将框架扩展到代理评估:工具准确性、幻觉检测率和轨迹长度偏差。 BabelJudge 作为 Python 包发布,支持 11 个法官后端。代码:https://github.com/Shreyaskc/BabelJudge