论文
LLM即验证器:通用验证框架
LLM-as-a-Verifier: A General-Purpose Verification Framework
摘要
扩展预训练、后训练与测试时计算已成为提升LLM能力的中心范式。本工作把验证——判定解答正确性的能力——识别为新的扩展轴。为解锁并展示其有效性,我们提出LLM-as-a-Verifier:一个为智能体任务提供细粒度反馈、无需额外训练的通用验证框架。不同于提示LLM为候选解产出离散分的标准LM裁判,LLM-as-a-Verifier对打分token logits的分布取期望生成连续分数。该概率化表述使验证沿多维度扩展:(1) 打分粒度;(2) 重复评估;(3) 准则分解。特别是,扩展打分粒度带来正负解间更好的分离、产生更校准的比较;扩展重复评估与准则分解经方差与复杂度降低一致带来验证准确率增益。我们进一步引入用验证器连续分选最佳解的成本高效排序算法。LLM-as-a-Verifier在Terminal-Bench V2(86.5%)、SWE-Bench Verified(78.2%)、RoboRewardBench(87.4%)与MedAgentBench(73.3%)取得最先进表现。除验证外,细粒度信号还可作为任务进度估计的代理——我们构建了Claude Code扩展使开发者能监控并改进其智能体系统。最后展示LLM-as-a-Verifier可为RL提供稠密反馈,改善SAC与GRPO在机器人与数学推理基准上的样本效率。
