论文

判断电路解释 LLM-as-a-Judge 中格式引起的不一致

Judge Circuits Explain Format-Induced Inconsistency in LLM-as-a-Judge

模型评测模型行为与机制分析

摘要

LLM-as-a-judge 已成为大规模对模型输出进行评分的主导范例,但当其输出格式发生变化时,同一模型会系统地分配不同的分数(例如,1-5 评级与 True/False 标签)。对这些格式引起的不一致的现有诊断停留在输入输出级别。使用位置感知边缘归因修补(PEAP),我们在五个判断任务中因果关系研究了五个开放权重指令调整模型(Gemma-3、Qwen2.5、Llama-3.1)的内部机制。我们发现,跨结构化理解和开放式偏好任务的判断在中后期层共享一个稀疏的潜在评估器子图;零消融会破坏判断力,同时对知识探针的损害远远小于架构模块化模型中相同大小的随机消融。通过在结构上将抽象判断与输出格式解耦,我们对我们研究的开放权重模型中格式引起的不一致提供了机械解释:在共享主干中计算的连续判断信号通过脆弱的、特定于格式的终端分支进行映射。因此,可以独立于所请求的输出格式来读出判断本身。我们的研究结果表明,不同格式的法官可靠性的基准比较部分衡量了脆弱的格式阶段,并且可能低估了基础评估的质量。