论文
推理收敛时停止:推理模型的语义保留提前退出
Stop When Reasoning Converges: Semantic-Preserving Early Exit for Reasoning Models
摘要
大型推理模型(LRM)通过生成长思维链(CoT)来实现强大的性能,但往往会过度思考,在解决方案已经稳定后继续推理,从而浪费词元并增加延迟。现有的推理时间提前退出方法主要依赖于答案级别的信号,例如置信度或试验答案一致性,来决定何时停止。然而,这些信号主要反映答案准备情况而不是推理收敛:它们可能在模型完成探索或自我纠正之前触发,导致过早退出,从而降低最终答案的准确性并使保留的推理链在语义上不完整。我们将推理级语义冗余视为语义保留早期退出的补充信号:当连续的步骤不再增加新的进展而是重新审视已建立的结论时,推理轨迹可能已经收敛。基于这一见解,我们提出了 PUMA,这是一种即插即用框架,它将轻量级冗余检测器与答案级验证相结合。检测器标记语义上冗余的候选退出,同时验证确认停止是否安全,从而允许 PUMA 删除冗余的延续,同时保留答案准确性和连贯的推理前缀。在五个 LRM 和五个具有挑战性的推理基准中,PUMA 实现了 26.2% 的平均标记减少,同时保持了准确性和 CoT 质量。关于代码生成、零样本视觉语言推理和学习停止策略内化的其他实验进一步证明,推理级冗余是用于高效推理的鲁棒、可转移和可学习的信号。我们的代码可在 \url{https://github.com/giovanni-vaccarino/PUMA} 获取。