论文

评审何时不应决策:证据锁定、非补偿性选择约束推理管线中的大语言模型评审失效

When the Judge Should Not Decide: Evidence-Locked, Non-Compensatory Selection Bounds LLM-Judge Failure in Reasoning Pipelines

模型推理推理验证与自校正

摘要

部署在推理管线中的大语言模型评审不只是衡量质量,它还决定哪个答案被交付。我们表明,该决策的成本与其说取决于评审的准确率,不如说取决于评审所处的决策规则。在来自四个GRPO策略的冻结候选池上,一个无约束的标量DeepSeek-R1-7B评审相比答案级多数投票几乎无所增益(500道GSM8K题上+1.0个百分点,300道HotpotQA题上+0.34 EM),而在30题的冻结规则确认划分上比多数投票差10分——一个在自信打分的同时破坏准确率的评审。随后,我们让同一个评审服从证据锁定的推导-门控-修复(Evidence-Locked Derive-Gate-Repair, EL-DGR),一种任务自适应的非补偿性规则:评审偏好只有在具备可抽取的证据证书时才能推翻有证据支撑的共识,而只有当两个备选均未获认证而修复获认证时才执行修复。在不改变评审、候选或预算的情况下,EL-DGR在GSM8K上达到58.2%(对比评审的56.8%、多数投票的55.8%、首个候选的55.4%),在HotpotQA上达到17.33 EM / 25.46 F1(对比15.67/23.49、15.33/23.19、15.33/22.97),相对首个候选GRPO分别提升+2.8个百分点(精确McNemar检验p=0.0026)与+2.00 EM(p=0.070,处于边缘)。决策审计揭示了原因:EL-DGR仅在30道试点题中的8道上推翻共识,且从未将正确共识转为错误答案。我们还报告了无效的尝试:同一七通道分解作为步级门控训练奖励时结果为零,而修正通道丢弃后的消融显示没有任何通道单独必要(全程p=1.0)。面向实践者的结论对评审是否定的,对可采性是肯定的:约束评审的影响范围,而不是试图让它更准。

评审何时不应决策:证据锁定、非补偿性选择约束推理管线中的大语言模型评审失效:论文配图
图1:评判者即选择器流程。候选与任务输入由LLM评判者在七个诊断性方面打分(表1),而非单一标量;一条证据锁定规则随后将候选划分为可行性层级,评判者的偏好仅在层级内部对候选排序,且只有当不存在已认证候选时才允许经校验的修复进入。精确排序见式(3)。