论文

UPAIR:经不确定性—进度对齐诊断推理状态以做选择性干预

UPAIR: Diagnosing Reasoning States via Uncertainty-Progress Alignment for Selective Intervention

模型推理推理验证与自校正

摘要

测试时扩展以额外推理计算改善大型推理模型(LRM)的解题能力,但也会加剧过度思考与思考不足——我们将其形式化为推理状态—行动失配。解决失配需要可靠的推理状态诊断,而单信号监视器提供模糊证据,基于转向的控制器又常依赖结果标注监督或模型特定校准。我们提出不确定性—进度对齐假说:代理答案不确定性与潜在推理进度的相对转移时序可区分健康、停滞与就绪三类状态,各类应采取不同的后续行动。基于此洞见,我们提出UPAIR,一个免训练框架:把轻量不确定性监控与事件触发的联合诊断耦合,把所得状态映射到原生继续、选择性策略切换或验证引导的停止。跨三个LRM与五个跨领域基准,停滞诊断检出64.3%的自然错误、仅误报5.4%的正确样本,揭示一个跨模型跨任务共享的动态推理规律性。端到端,UPAIR把准确率提升最高16.67个百分点、生成token减少最高29.64%,而在线诊断成本不足自然生成时间的1%。

UPAIR:经不确定性—进度对齐诊断推理状态以做选择性干预:论文配图
图 1:动机:不确定性与进展的一致性。 QwQ-32B 在 MATH-500 样本上的推理动态。