论文

推理轨迹前缀的保形认证

Conformal Certification of Reasoning Trace Prefixes

模型推理推理验证与自校正

摘要

语言模型的推理轨迹很少是全对或全错的;它们往往在关键错误发生之前包含有效的中间步骤。现有的不确定性量化方法通常只认证最终答案或整段回复,无法为序列轨迹中可被安全保留的比例提供统计保证。为解决这一问题,我们提出CROP(Conformal Reasoning Output Prefixes),一个与验证器无关的干净前缀认证校准程序。给定任意步级风险代理,CROP选取一个经校准的阈值,返回步级风险代理持续低于该阈值的最长连续前缀,并将未认证的后缀送往下流的审查或修复环节。在可交换性假设下,CROP严格控制返回前缀包含已标注错误的边际概率。在六个带过程标注的推理数据集上,我们证明AUROC等标准步级指标并不能完全刻画前缀效用,提示验证器应改以认证前缀长度来评估。此外,CROP在过度保留与保留不足之间取得平衡,通过保留有效中间推理、丢弃误导性后缀来提升下游修复准确率。最终,本工作将前缀认证定位为连接过程监督、弃答与修复的严谨而实用的桥梁。

推理轨迹前缀的保形认证:论文配图
图 1:CROP 返回完整推理轨迹的校准前缀。我们展示了解决算术和 GSM8K 数据集问题的两个示例轨迹。对于每个推理实例中的每个步骤,CROP 都会计算一个风险代理,值越大表示估计错误风险越高。使用保留的校准推理实例,CROP 选择一个阈值来控制保留的前缀包含带注释的错误步骤的边际概率。在测试时,CROP 返回最长的连续前缀(绿色),其风险代理仍低于校准阈值。剩余的后缀(红色)未经认证,可以发送至下游审查或修复(蓝色)。