论文
第一个词元不是判决:阅读LLM评审而不生成的隐藏成本
The First Token Is Not the Verdict: Hidden Costs of Reading LLM Judges Without Generating
摘要
从第一个生成的词元的logits中读取 LLM 评审的判决很便宜,不需要生成,并且正是约束解码和似然评分评估Harness所产生的结果。我们表明,这种读数在一个方向上扭曲了位置偏差:它在我们测试的每种条件下都夸大了位置偏差,因此以这种方式获得的数字表现为上限。其机制是,评审并不总是以判决标记为主导,对于三个 Qwen3 评审来说,在 12% 到 49% 的配对上,对于 Llama-3.1-8B 和 Phi-3.5-mini 来说,这一比例低于 3%,并且强制读取这些配对会返回首先显示的响应而不是判断。汇集了评审尚未给出明确判断的 924 对,当交换响应时,强制读取翻转了其中的 89.7%,而生成后读取的翻转率为 47.5%(配对差值 +0.422,95% CI [+0.365,+0.467])。这种扭曲是特定于所测量的内容的:它将位置偏差移动了 42 个点,而十个条件中的七个将评审准确率移动了不到 1 个点,因此它误导了审核评审的人,而不是使用评审的人。即使评审确实以判决标记开头,也会出现第二个较小的失败,因为它有时以一个字母开头,然后推理到另一个字母,在 0 到 5.5% 的配对上,其比率与遵守情况不相关。我们建议报告评审以判决标记领先的比率,该判决标记测量仅需一次前向计算且无需标签,以及任何位置偏差数据。