论文

综合 LLM-as-Judge 语料库中的测试预言机问题:消失、扭曲和验证协议

The Test Oracle Problem in Synthetic LLM-as-Judge Corpora: Disappearance, Distortion and a Validation Protocol

模型评测评测方法与指标

摘要

对 LLM 作为法官系统中的偏见的研究通常通过提示 LLM 生成与事实答案配对的幻觉答案,然后将两者呈现给法官来构建合成语料库。我们报告了一个案例,其中这一生成步骤默默地失败了,并用它来论证失败模式是结构性的而不是偶然的。在多语言(土耳其语/英语)忠实性 判断语料库中,判断和生成调用之间共享的解码预算参数将一位制作人的幻觉答案截断为几个单词。由此产生的项目产生了一个巨大的、统计上稳健的效应:一位法官的选择准确性出现了 32 点的跨语言崩溃,从 N=50 复制到 N=500,由三层机械账户解释,并由受控生产者交换实验证实,但这些实验都不是真实的。一旦共享参数被纠正,效果就消失殆尽,只有手动读取原始代,而不是任何聚合统计检查,才能暴露错误。第二个测量偏差(Markdown 格式偏好)不是捏造的,而是由于相同的错误而扭曲的,其大小以及在一种情况下其符号随刺激长度的变化而变化,模式聚合指标无法与第一个偏差区分开来。我们使用测试预言机问题来构建潜在的漏洞:负面示例是 LLM 生成的语料库没有机械方法来验证项目完整性,而通过标准答案的确定性扰动构建的语料库则免费提供项目级预言机。正控制直接支持这一主张:通过零成本、零人力的标准答案与负例字符串比较,可以 100% 准确地捕获注入到基于最小扰动的语料库中的类似错误。我们最后给出了一个验证协议,该协议源自我们自己的案例,适用于在无预言机体系中工作的分析师,我们认为该协议描述了大多数当代多语言 LLM 作为法官语料库。