论文

面向大语言模型带有效事实性控制的推理时保形推理

Inference-Time Conformal Reasoning with Valid Factuality Control for Large Language Models

模型推理推理验证与自校正

摘要

大型语言模型 (LLM) 越来越多地执行多步骤推理,其中中间声明形成隐式有向无环图,其节点正确性在结构上取决于其祖先。这使得事实不确定性成为结构性的,而不是节点错误的微不足道的积累,并且需要对推理结构进行推理时间不确定性量化。虽然保形预测(CP)提供了灵活的用户指定的事实控制,但现有的工作仍然是事后的,并且不能在生成过程中进行干预。为了填补 CP 的灵活性与其事后限制之间的差距,我们提出了一个 \emph{推理时间保形推理(ITCR)} 框架,该框架将 CP 直接集成到推理图生成中。 ITCR 学习结构级事实不确定性函数,该函数在推理图上聚合声明级事实性信号,而无需复杂的建模假设。然后,我们根据图级事实不确定性设计不合格分数,并校准共形阈值来决定何时停止生成。我们从理论上证明这种生成是嵌套的,为事实控制提供有效的覆盖保证。对多个数据集和覆盖目标的实验证明了覆盖范围在经验上是有效的。在下游推理任务中,推理时间校准图比事后修剪图产生更准确的生成。

面向大语言模型带有效事实性控制的推理时保形推理:论文配图
图 1:之前的事后剪枝(Rubin-Toles 等人,2025 年)与我们在 LLaMA-3.1-8B-Instruct 和 GSM8K 数据集的示例中的推理时间生成(Cobbe 等人,2021 年)。 (左)具有基本事实的原始输出。中间步骤被注释为正确(蓝色)和错误(红色)。 (中)现有的事后方法。完整生成后,共形过滤会修剪超过阈值的步骤,然后进行第二遍删除缺少祖先的步骤。 (右)我们的方法。在推理时执行保形校准:在每次扩展时检查分数,并且当超过阈值时立即停止生成。中图和右图使用相同的置信度分数和 85%85\% 置信水平;保证两个输出不包含实际上不正确的步骤。