论文
SELFDOUBT:基于Hedge-to-Verify比率的推理型LLM不确定性量化
SELFDOUBT: Uncertainty Quantification for Reasoning LLMs via the Hedge-to-Verify Ratio
摘要
推理型语言模型的不确定性估计在实践中仍难以部署:基于采样的方法计算开销大,而言语化置信度或轨迹长度等常见单次前向代理指标在不同模型间往往不一致。对于既不暴露logits也不暴露中间令牌概率的专有推理API,这一问题更加严重,从业者因此在推理时没有可靠的不确定性信号可用。我们提出SELFDOUBT,一个单次前向的不确定性框架,通过直接从推理轨迹本身提取行为信号来打破这一僵局。其关键信号Hedge-to-Verify Ratio(HVR)检测推理轨迹中是否含犹豫性标记,以及(若存在)这些标记是否被显式的自我检查行为所抵消。与需要多次采样轨迹或模型内部信息的方法不同,SELFDOUBT仅作用于单条观测到的推理轨迹,因此适合在延迟与成本受限的条件下部署于任何专有API之上。我们在七个模型和三个多步推理基准(BBH、GPQA-Diamond和MMLU-Pro)上评估SELFDOUBT。最值得注意的是,不含犹豫标记的轨迹有96%的概率是正确的,揭示了一个零额外成本、自然涌现的高精度置信度门控。对于其余情形,完整的SELFDOUBT分数以低10倍的推理成本显著优于基于采样的语义熵。结合两阶段的部署级联在无任何任务特定标签的情况下,以71%的覆盖率取得90%的准确率。这些结果确立了SELFDOUBT作为面向专有推理模型、可扩展且生产就绪的不确定性估计基础。
