论文

评价指纹:LLM评价器行为的稳定且系统性差异

Evaluative Fingerprints: Stable and Systematic Differences in LLM Evaluator Behavior

模型评测模型行为与机制分析

摘要

LLM-as-judge 系统承诺可扩展、一致的评价。我们发现恰恰相反:评价器是一致的,但不是彼此一致,而是与自身一致。在 3240 次评价(9 个评价器 × 120 个唯一的“视频×包”条目 × 3 次独立运行)中,评价器间一致性接近零(Krippendorff's α = 0.042)。在两个维度上,评价器之间的分歧甚至超过随机噪音的预期(α < 0)。然而这种分歧并非混乱,而是有结构的。仅凭评分细则(rubric)得分,一个分类器就能以 77.1% 的准确率识别出某次评价出自哪个评价器;加入倾向性特征后升至 89.9%。在模型家族内部,信号更强:GPT-4.1 与 GPT-5.2 能以 99.6% 的准确率被区分开。我们称之为可靠性悖论:评价器无法就什么构成质量达成一致,但它们的分歧模式稳定得可以作为指纹。每个评价器都实现了一种独特而稳定的质量理论:一种“评价倾向”(evaluative disposition),塑造它解读任何评分细则的方式。我们从多个轴刻画这些倾向:严苛/宽松、维度侧重、评价器内稳定性(ICC)以及证据行为(凭证有效性、经 NLI 的语义关联、shotgun 指数)。其含义十分尖锐:LLM 评价器不是测量同一构念的可互换仪器,而是各自编码了自身隐性质量理论的独立测量装置。对它们的分数取平均,会得出一个不对应任何评价器实际价值的合成判定。