论文
JEV-as-a-Judge:有把握时接受,没把握时升级
JEV-as-a-Judge: Accept When Confident, Escalate When Unsure
摘要
LLM-as-a-judge使跨任务的评测成为可能,但在规模化时推理成本与置信度可靠性变得至关重要。我们研究一个仅做决策的裁判能否提供经济的第一道筛查,并识别何时需要更强的评测。在盲测人工裁决下,将jev-as-a-judge与十六个生成式及奖励模型裁判比较,我们发现它在普通偏好与证据支撑的事实性判断上与最先进的LLM裁判——我们最强的对比对象——相差不到三个百分点,而费用仅为后者的0.36%。当判断需要核对推导过程或抵御精心撰写的错误答案时,差距更大。在若干基准上,JEV与该对比对象的差距集中在低置信度决策上。一个冻结的级联——接受高置信度判决、升级不确定判决——以更低成本保留了对比对象99%的准确率。
