论文

通过置信度动态提前停止大型推理模型

Early Stopping for Large Reasoning Models via Confidence Dynamics

模型推理解码与生成控制

摘要

大型推理模型依赖于长的思维链生成来解决复杂问题,但扩展推理通常会产生大量的计算成本,甚至会因过度思考而降低性能。一个关键的挑战是确定模型何时应停止推理并产生最终答案。在这项工作中,我们研究推理过程中中间答案的置信度,并观察两个特征行为:正确的推理轨迹通常会较早达到高置信度答案,而错误采样轨迹往往会产生长的、无效的推理轨迹,并表现出不太可靠的置信动态。受这些观察的启发,我们提出了 CoDE-Stop(置信动态提前停止),这是一种提前停止方法,利用中间答案置信度的动态来决定何时终止推理,不需要额外的训练,并且可以轻松集成到现有模型中。我们在多个模型的不同推理和科学基准上评估 CoDE-Stop。与之前的早期停止方法相比,它实现了更有利的精度计算权衡,并且与标准全长推理相比,总词元使用量减少了 25-50%。此外,我们还提供推理过程中信心动态的分析,深入了解信心在正确和错误轨迹中如何变化。