论文

VERDI:通过分解推理对基于验证的 LLM 判断进行单次调用置信度估计

VERDI: Single-Call Confidence Estimation for Verification-Based LLM Judges via Decomposed Inference

模型评测评测方法与指标

摘要

LLM-as-Judge系统被广泛部署用于自动评估,但从业者缺乏可靠的方法来知道何时应该信任法官的判决。词元对数概率(标准事后置信度信号)对于许多商业 LLM 来说是不可用的,即使可以访问,在结构化 JSON 输出中也会饱和到 0.999 以上。我们引入了 VERDI(验证分解推理),这是一种从结构化判断已经生成的推理轨迹中提取置信度的方法,无需额外的推理调用。 VERDI 将每个验证式评估分解为子检查,并得出三个结构信号:步骤判决对齐、声明级裕度和证据基础分数。我们将它们与 Platt 尺度逻辑回归结合起来。在三个公共基准测试中,VERDI 在 GPT-4.1-mini 上实现了 AUROC 0.72-0.91,在 GPT-5.4-mini 上实现了 0.66-0.80。在 Qwen3.5-4B/9B/27B 上,答案标记对数概率经过反校准(错误置信度更高,AUROC 0.32-0.49),VERDI 达到 0.56-0.70。我们还在具有八个量规的生产系统上进行了验证(事实量规上的 AUROC 0.73-0.88),演示了跨模型传输(AUROC 0.66-0.69),并表明 33M 参数 NLI(自然语言推理)模型为正则表达式提取提供了可扩展的替代方案。