论文

你的推理模型是否隐式地知道何时停止思考?

Does Your Reasoning Model Implicitly Know When to Stop Thinking?

模型推理解码与生成控制

摘要

大型推理模型(LRM)的最新进展通过长思维链(CoT)大幅提升了其在复杂推理任务上的能力。然而,这种做法常导致大量冗余,损害计算效率并造成实时应用的显著延迟。近期研究表明,更长的推理链往往与正确性无关,甚至可能损害准确率。在对这一现象的进一步深入分析中,我们惊讶地发现并实证验证:LRM 隐式地知道合适的停止思考时机,只是这一能力被当前的采样范式所掩盖。受此启发,我们提出 SAGE(Self-Aware Guided Efficient Reasoning),一种释放这种高效推理潜力的新采样范式。此外,将 SAGE 作为混合采样集成到基于分组的强化学习中(得到 SAGE-RL),能使 SAGE-RL 有效地把 SAGE 发现的高效推理模式纳入标准 pass@1 推理,在多个具有挑战性的数学基准上显著提升 LRM 的推理准确率与效率。

你的推理模型是否隐式地知道何时停止思考?
图6:观察2的示意图。当依据模型在每个扩展步骤的置信度来保留推理分支时,模型能够以很强的置信度对它们得出结论。