论文
后训练 转变信心:SFT、RL 和 OPD 如何塑造 CoT 校准的三阶段分析
Post-Training Shifts Confidence: A Three-Stage Analysis of How SFT, RL, and OPD Shape CoT Calibration
摘要
大语言模型 通过监督 微调、强化学习和 同策略 蒸馏 取得了强大的推理收益,但这些 后训练 方法通常仅通过最终答案准确性进行评估。我们研究他们如何在推理过程中重塑信心。我们引入了一个三阶段校准框架,用于评估思想链生成之前、期间和之后的置信度,对应于难度估计、提前终止和答案聚合。通过对数学推理基准的受控比较,我们发现 OPD 提供了最有用的预推理置信度,SFT 为提前停止提供了最强的在线信号,RL 为聚合提供了最可靠的跟踪级信号。我们进一步表明,置信度可靠性与位置相关:RL 置信度在路径承诺阶段后变得信息丰富,而 OPD 置信度在早期有用,但可以在以后进行反向校准。基于这一观察,我们提出了 PosConf,一种位置感知置信度策略,仅使用来自可靠相对位置区间的置信度。 PosConf 将 RL 答案聚合比多数投票提高了 6.1 个点,并在严格的 词元预算 下持续改进了 OPD 提前停止,通过避免其后期的逆校准区域,增益高达 4.3 个点,这表明 \emph{推理模型的置信度应该同时使用阶段性和位置感知}。我们的代码可在 https://github.com/EIT-NLP/后训练-Calibration 获取。