论文

置信度自监督微调带来更短的推理

Learning to Stop without Learning to Stop: Self-Supervised Confidence Training Improves Reasoning Efficiency

模型训练监督微调与指令调优

摘要

推理模型通常会生成很长的推理轨迹,使得推理的计算成本很高。现有方法通常通过推理时间提前停止机制或通过在训练期间明确鼓励较短的推理(例如通过带有长度惩罚的强化学习)来提高效率。我们证明,显着的效率提升可以来自不同类型的监督:\textit{confidence}。使用自我监督程序,我们仅使用 600 个训练问题来微调推理模型,以预测他们沿着自己的推理轨迹在中间点对答案的信心。置信度仅用作训练目标:损失不包含推理长度、效率或停止的目标。在推理时,微调模型使用标准生成程序,没有置信度诱导或提前停止机制。尽管如此,自监督置信度微调使推理更加高效,在数学、科学和编码推理基准上的 Gemma、Qwen、Nemotron 和 GPT-OSS 模型的匹配精度下,生成的标记减少高达 25%,其效率增益与显式优化较短推理的方法相当。对推理事件的分析进一步表明,置信监督在很大程度上保留了基础模型的高级推理成分,而不是选择性地抑制特定行为。我们的结果表明,有效推理可能作为学习元认知信号的下游结果而出现,而无需直接优化。

不同效率方法相对基础策略的推理活动占比变化与整体分布差异。
图5(图注摘要):不同效率方法相对基础策略的推理活动占比变化与整体分布差异。