论文

JEV-as-a-Judge:有把握时接受,没把握时升级

JEV-as-a-Judge: Accept When Confident, Escalate When Unsure

模型评测模型推理判别式推理与决策评测方法与指标Jev

摘要

LLM-as-a-judge使跨任务的评测成为可能,但在规模化时推理成本与置信度可靠性变得至关重要。我们研究一个仅做决策的裁判能否提供经济的第一道筛查,并识别何时需要更强的评测。在盲测人工裁决下,将jev-as-a-judge与十六个生成式及奖励模型裁判比较,我们发现它在普通偏好与证据支撑的事实性判断上与最先进的LLM裁判——我们最强的对比对象——相差不到三个百分点,而费用仅为后者的0.36%。当判断需要核对推导过程或抵御精心撰写的错误答案时,差距更大。在若干基准上,JEV与该对比对象的差距集中在低置信度决策上。一个冻结的级联——接受高置信度判决、升级不确定判决——以更低成本保留了对比对象99%的准确率。

JEV-as-a-Judge:有把握时接受,没把握时升级:论文配图
图1:从人工评估到仅输出决策的评判。人工评估依赖专家判断;生成式 LLM 评判器可在决策之外生成理由。JEV 直接提供带类型的决策和标签概率,并将其汇总为置信度。该图比较评估接口;实验中的生成式基线也被要求输出决策与概率。