论文

通过保形抽样通过泛化证书控制条件事实性 LLM

Conditional Factuality Controlled LLMs with Generalization Certificates via Conformal Sampling

模型推理推理验证与自校正

摘要

大语言模型 (LLM) 需要可靠的幻觉测试时间控制。 LLM 的现有共形方法通常仅提供 \emph{marginal} 保证,并依赖于单个全局阈值,该阈值可以掩盖硬提示,过度覆盖简单提示,并产生超大的预测集。我们提出了\emph{条件事实控制}(CFC),这是一个事后共形框架,它返回\emph{集值}输出并保证\emph{条件}覆盖。 CFC 通过对潜在“成功”分数进行增强分位数回归来定义连续的、特征条件接受阈值,并在推理时通过定点阈值规则来部署它。理论上,我们证明 CFC 在可交换性下满足条件覆盖保证,并分析其 \emph{效率},证明在分数分布的温和假设下,条件规则在相同目标覆盖率下比边际共形预测严格上具有更高的样本效率。我们进一步推导出 PAC 式变体 CFC-PAC,它根据稳定性界限缩小名义风险水平,产生有限样本证明,条件误覆盖与目标的偏差最多为 $O(\sqrt{\log(1/δ)/N})$。根据经验,在合成数据、现实世界推理和 QA 基准以及 Flickr8k VLM 设置上,CFC 和 CFC-PAC 在使用比 CP 和非 CP 基线更小的预测集的同时,始终能够实现跨难度组的接近目标覆盖。