论文

法官喜欢英语吗?评估 LLM-as-a-Judge 中的语言切换不变性

Does the Judge Prefer English? Evaluating Language-Switching Invariance in LLM-as-a-Judge

模型评测评测方法与指标

摘要

大语言模型 (LLM) 现在被广泛用作开放式指令跟踪评估的自动判断器。这种做法方便、可扩展,并且通常比基于参考的指标更具语义意识,但它也引入了一个新的可靠性问题:法官是否评估答案的质量,或者是否也会对比较所用的语言做出反应?我们提出 Judge-LS,一种轻量级元评估协议,可将 LLMBar 响应对项目转换为英语、中文和中英语言切换变体。可靠的法官应该在保留标签的语言转换下保留其偏好,并且当两个答案翻译等效时不应偏好某种语言。我们在完整的 419 项 LLMBar 基准测试中评估了 4 个可通过 API 访问的判断器,产生了 13,408 个成功的成对判断。在各个模型中,中文和语言转换演示相对于英语引起了 10.7--14.4% 的偏好翻转,并且所有评委在英语中都达到了最高准确率。然而,翻译等效的平局探针并没有揭示出系统的英语偏好:大多数探针被判断为平局,而非平局决策通常更倾向于中文。我们添加置信区间、配对显着性检验以及自动转换审核和敏感性分析,排除机械标记的高风险变体。该实验不需要 模型训练,仅使用 API 调用,并且在适度的本地硬件上可行。