论文
对评分者进行评分:LLM 推理的验证自主级别 (L0-L5)
Grading the Graders: Verification Autonomy Levels (L0-L5) for LLM Reasoning
摘要
大语言模型 (LLM) 越来越多地与声称能够检测模型错误的验证器(步骤检查器、自洽过滤器、基于工具的事实检查器、形式证明助手)配对。然而,验证文献使用“级别”一词来表示至少五种不同的事物:验证粒度、概念抽象、风险层、系统堆栈层和 真值 的认知源。我们提出验证自主级别(VAL),这是一种元标准,它沿单个轴对任何验证方案进行分类:验证规范从何而来,判决保证什么? VAL 的范围从 L0(LLM 自我声明;无确定性锚)到 L2(目标 真值;仅正确性)到 L3/L4(具有单属性或域级完整性的可判定系统),在不受限制的情况下,L5 是不可能的。 VAL 的核心是完整性盲点:基于替换和抽样的验证者可以确认提议的候选者成立,但无法证明没有遗漏任何候选者。我们进一步确定了文献中未提及的二分法:只有在形式上可指定的属性下才能达到完整性,而经验开放世界验证(事实检查、诊断)则限制了锚定正确性(L2)。我们在四个领域(符号数学、行为监控、医学诊断和代码生成,最后一个与证据之前陈述的预测进行反向验证)以及我们调查中最强的形式验证基线中实证地记录了这一差距,其作者指出验证者专注于每个步骤的正确性。我们展示了粒度级别、概念层次结构、风险和系统堆栈与 VAL 正交,解决了 17 篇调查论文的系统合并问题。代码和完整评估作为补充材料发布。