论文

多语言 LLM 评委中的排名逆转:无标签双中心校准器

Rank Reversal in Multilingual LLM Judges: A Label-Free Double-Centering Calibrator

模型评测评测方法与指标

摘要

多语言 LLM 法官根据提示语言产生不同的评估者骨干排名:在八种语言的代理作为法官基准上,排名最高的骨干在英语、阿拉伯语、中文、印地语、日语、西班牙语、土耳其语和斯瓦希里语之间交替,15 个骨干对中的 7 个显示出统计显着的成对排名反转。我们将其视为一个测量问题。多语言评判分数进一步分解为任务难度、骨干技能和语言-骨干交互项,最后一项可以通过对单元均值分数矩阵进行双中心化而在没有人工标签的情况下恢复。我们使这个估计器(\textbf{Consensus-Based Calibration},CBC)显式化,给出 $O(1/\sqrt{n})$ 有限样本浓度与方差常数 $(1-\tfrac{1}{m})(1-\tfrac{1}{k})$ 的界限,并表明即使存在任务语言交互,它也是无偏的。在 7{,}920 次法官运行中(6 个骨干网、8 种语言、55 种任务、3 个框架),CBC 将保留的跨任务排名一致性 $τ$ 从 0.650 提高到 0.902,并在 100\% 的每种语言决策中与保留的加性模型预言一致,而原始决策则为 68.5\%;这些是一致性诊断,而不是基于人的正确性措施。在单独收集的 M-RewardBench 小组(7 种语言,1{,}每种语言 500 个项目,10{,}500 个语言项目实例,5 名评估者)上,小组与公众人工标注偏好的一致性从 68.7\% 上升到 76.6\%(增加 7.9 个百分点,95\% CI $[6.0, 9.9]$),这是我们下游有用性的最有力的外部证据。估计器是和零对比下的标准双向 ANOVA 交互恢复操作;我们的贡献是它作为多语言 LLM 法官的无标签事后校准器的应用,明确的有限样本浓度界限,以及即使在任务语言错误指定的情况下也能保持无偏见的结果。