论文
推理轨迹前缀的保形认证
Conformal Certification of Reasoning Trace Prefixes
摘要
语言模型的推理轨迹很少是全对或全错的;它们往往在关键错误发生之前包含有效的中间步骤。现有的不确定性量化方法通常只认证最终答案或整段回复,无法为序列轨迹中可被安全保留的比例提供统计保证。为解决这一问题,我们提出CROP(Conformal Reasoning Output Prefixes),一个与验证器无关的干净前缀认证校准程序。给定任意步级风险代理,CROP选取一个经校准的阈值,返回步级风险代理持续低于该阈值的最长连续前缀,并将未认证的后缀送往下流的审查或修复环节。在可交换性假设下,CROP严格控制返回前缀包含已标注错误的边际概率。在六个带过程标注的推理数据集上,我们证明AUROC等标准步级指标并不能完全刻画前缀效用,提示验证器应改以认证前缀长度来评估。此外,CROP在过度保留与保留不足之间取得平衡,通过保留有效中间推理、丢弃误导性后缀来提升下游修复准确率。最终,本工作将前缀认证定位为连接过程监督、弃答与修复的严谨而实用的桥梁。
