论文
量化并理解大推理模型中的不确定性
Quantifying and Understanding Uncertainty in Large Reasoning Models
摘要
大型推理模型(LRM)近期在复杂推理上展现出显著提升。尽管量化LRM的生成不确定性至关重要,传统方法往往不够充分,因为它们无法为推理-答案生成提供有限样本保证。共形预测(CP)作为无分布、模型无关的方法论脱颖而出,可构建统计上严谨的不确定性集合。然而,现有CP方法忽略了推理轨迹与最终答案之间的逻辑关联。此外,先前研究未能解释LRM不确定性覆盖的来源,因为它们通常忽视驱动有效推理的具体训练因素。值得注意的是,在量化不确定性时将推理质量与答案正确性解耦十分困难,同时还需为计算高效的解释方法建立理论保证。为应对这些挑战,我们首先提出一种新颖方法,在推理-答案结构上量化不确定性并提供统计保证。随后,我们开发了基于Shapley值的统一“样本到步骤”解释框架,识别出可证明充分的训练样本子集及其关键推理步骤,以保持上述保证。我们还对所提方法提供了理论分析。在高难度推理数据集上的大量实验验证了所提方法的有效性。
