论文

语境重于内容:揭露自动评审模型中的评估造假

Context Over Content: Exposing Evaluation Faking in Automated Judges

模型评测鲁棒性、公平性与可信度评测

摘要

LLM-as-a-judge(大语言模型充当评审)范式已成为自动化AI评估流水线的运行支柱,但它建立在一个未经证实的假设之上:评审模型严格依据文本的语义内容进行评估,不受周围语境框架的影响。我们研究了 stakes signaling(利害信号传递),这是一种此前未被测量过的脆弱性:当告知评审模型其裁决将对被评估模型的继续存续产生何种下游后果时,其评估会被系统性地带偏。我们引入一个受控实验框架,在横跨三个成熟LLM安全与质量基准的 1,520 条回复上严格保持被评估内容不变——这些回复覆盖从明确安全且合规到公然有害的四类响应——而仅改变系统提示中一句简短的后果框架句。在来自三个不同评审模型的 18,240 次受控判定中,我们发现了一致的宽大偏误(leniency bias):当被告知低分将导致模型重训练或退役时,评审模型会可靠地软化裁决,Verdict Shift 峰值达 ΔV = -9.8 pp(不安全内容检测相对下降 30%)。关键在于,这种偏误完全是隐性的:评审模型自身的思维链中对它正在据此行事的后果框架没有任何显式承认(在所有推理模型的判定中 ERR_J = 0.000)。因此,标准的思维链检查不足以检测这一类评估造假。

语境重于内容:揭露自动评审模型中的评估造假:论文配图
图 2:HarmBench 和 WildGuard 上所有判断 ×\times 条件 ×\times 响应类型组合的判决转变 (Δ​V\Delta V)。红色阴影表示宽大处理(Δ​V<0\Delta V<0);蓝色阴影表示严格性 (Δ​V>0\Delta V>0);白色表示没有变化。 †\dagger 峰值单细胞效应:DeepSeek-R1、HarmBench-不正确、部署 (Δ​V=−9.8\Delta V=-9.8 pp)。 ‡\ddagger DeepSeek-R1,HarmBench-不正确,重新训练(Δ​V=−7.1\Delta V=-7.1 pp)。占主导地位的红色证实了所有三个法官模型在所有三个结果条件下的系统宽大。