论文

置信度感知对齐使推理LLM更可靠

Confidence-Aware Alignment Makes Reasoning LLMs More Reliable

模型训练偏好优化

摘要

大型推理模型常经由有缺陷的中间步骤到达正确答案,造成最终准确率与推理可靠性之间的鸿沟。既有对齐策略以外部验证器或海量采样解决,限制可扩展性。本工作提出CASPO(置信度感知步级偏好优化):一个经迭代DPO把token级置信度与步级逻辑正确性对齐的框架,无需训练独立奖励模型。推理时我们提出置信感知思考(CaT):利用该校准的置信度动态剪除不确定的推理分支,时延开销可忽略的O(V)。跨十基准与多模型家族的实验显示CASPO一致提升推理可靠性与推理效率。CASPO扩展到Qwen3-8B-Base,在不使用奖励模型数据的情况下在AIME'24与AIME'25上超越树搜索基线。我们还发布带置信度标注的步级数据集以支持推理可靠性的细粒度分析。代码见GitHub。

置信度感知对齐使推理LLM更可靠:论文配图
图 1:CASPO 概述:校准推理的统一框架。 CASPO 首先通过迭代偏好优化将内在不确定性与逐步正确性结合起来,然后利用这种校准后的置信度在推理过程中动态修剪推理树。