论文

模型评判器的一致意见不等于与人类判断一致

The Geometry of LLM-as-Judge: Why Inter-LLM Consensus Is Not Human Alignment

模型评测评测方法与指标

摘要

LLM评判器广泛用于开放式语言输出评分,模型间一致常被当作可信依据。但一致既可能来自共同识别质量,也可能来自共同盲点,仅凭一致性统计无法区分。研究将各评判器得分表示为向量,在两个社区构建、覆盖四领域与八语言的印度语言基准上,分析42种评判器的分散程度、有效秩、与人类得分的夹角,以及模型间、模型与人类、人类间的一致性。每次比较使用同一参考:模型与留出的人类评判者都对照相同的两人平均评分,避免平均参考人为改善模型表现。在主观评分标准上,模型间一致程度与人类间相近,但模型与人类的一致程度仅为人类间一致程度的58%—66%,且常聚焦人类不重视的方向。对于有可验证答案的评分项,差距大幅缩小。模型集成趋向模型共有方向而非人类方向,训练扩大得分分布但未改变方向。只有通过此检查,模型间一致才能作为与人类判断对齐的证据。