论文
承诺前的证据锁定:冻结的界面降低了 LLM 作为法官的评估
Evidence Lock Before Commitment: A Frozen Interface Degrades LLM-as-Judge Evaluation
摘要
LLM 法官经常被要求在候选答案之间进行选择之前提取标准和证据。此工作流程假设中间记录保留稍后判决所需的信息。对于具有推理能力的模型,可见字段顺序不会揭示内部决策顺序,因此我们测试了一种可观察的替代方案:将证据保留在一次调用中,并使其成为下一次调用的唯一输入。在 HelpSteer3、FeedbackQA 和 CoVal 上的 24,000 次判断中,我们将标准成对判断、结构化单次判断、两次调用证据锁定和三次调用逐点锁定与 Claude Sonnet 4.5 和 GPT-5 进行比较。相对于结构化的一通判断,证据锁定将与已发布的人类偏好的一致性降低 4 到 6 个百分点,并将答案顺序不一致增加 8 到 10 个百分点。逐点锁定也是有害的,而结构化证据启发仍然接近标准判断。结果适用于两位法官和所有三个数据集。持久证据可以支持可审计性,但不应在决策时取代源答案。