论文

通过同策略 Self-蒸馏减轻LLM法官中的Rubric干扰

Mitigating Rubric Interference in LLM Judges via On-Policy Self-Distillation

摘要

LLM 评委越来越多地根据细粒度的评估表来评估回答。当样本需要多个评分标准时,当前的方法通常在单独的推理调用中评估每个评分标准。一次性评估所有评分标准是一种效率更高的自然替代方案,但我们发现它会引入评分标准干扰:对一个评分标准的判断会根据同时存在的其他评分标准而变化。在一项初步研究中,在不同组成的标题集下进行评估时,只有三分之一的样本获得完全一致的结论。我们开发了一个测量框架,通过四个受控操作来探测干扰:标题集扩展、子集化、重新排序和噪声注入。为了在没有外部监督的情况下减轻干扰,我们提出了自锚定红字对齐(SARA)。 SARA 使用模型自己的单标题判断作为稳定锚点,并通过 同策略 自 蒸馏 将多标题推理与这些锚点对齐。我们在三个数据集(HealthBench、FLASK、ResearchQA)和两个模型系列(Qwen3、Llama-3.1)上验证 SARA。 SARA 不断提高评估一致性,同时与基础模型和作为参考判断的 GPT-4.1 保持一致。此外,学习到的一致性在数据集之间转移,证实 SARA 教授的是通用能力,而不是拟合数据集特定的模式。