论文

当语言不一致时:自我进化的多语言 LLM 法官

When Languages Disagree: Self-Evolving Multilingual LLM Judges

模型评测评测方法与指标

摘要

多语言 LLM-as-a-judge 被广泛用于评估跨语言的模型输出,但存在跨语言不一致的问题(Fu 和 Liu,2025)。现有的方法通常将这种不一致视为噪音,并通过投票或聚合来减轻它。在这项工作中,我们相反表明多语言不一致可以提供互补的评估信号。我们的预言机分析发现,跨语言的抽样判断比单语言判断产生更高的性能上限,这表明不同的语言可能包含互补的判断。受这一发现的启发,我们提出了 SEMJ,这是一种自我进化的多语言法官,它利用跨语言的不一致性进行迭代改进。 SEMJ 构建每个输入的多语言变体,收集独立的判断和理由,并将不一致的输出反馈回来进行自我反思和重新评估。多个基准的实验表明,SEMJ 在准确性和跨语言一致性方面始终优于投票和反思基准。进一步分析表明,不一致会触发有用的重新评估,从而提高判断质量。