论文

推理模型中不确定性估计如何随采样扩展

How Uncertainty Estimation Scales with Sampling in Reasoning Models

模型评测鲁棒性、公平性与可信度评测

摘要

不确定性估计对于部署推理语言模型至关重要,但在长链式思维推理下仍缺乏充分理解。我们研究并行采样作为一种完全黑盒的方法,利用言语化置信度(verbalized confidence)与自洽性(self-consistency)两类信号。在涵盖数学、STEM与人文学科的三个推理模型和17项任务上,我们刻画了这些信号如何随采样规模扩展。在推理模型中,自洽性与言语化置信度均可随采样扩展,但自洽性的初始判别力较低,在中等采样规模下落后于言语化置信度。然而,大多数不确定性增益来自信号组合:仅用两个样本,混合估计器平均就能将AUROC提升至多+12,并且即使单一信号被扩展到大得多的采样预算,混合估计器仍优于任一单独信号,此后收益开始递减。这些效应依赖于领域:在数学这一RLVR式后训练的原生领域中,推理模型取得更高的不确定性质量,并表现出比STEM或人文学科更强的互补性与更快的扩展速度。