论文

推理模型的统计早停方法

Statistical Early Stopping for Reasoning Models

模型推理解码与生成控制

摘要

尽管 LLM 的推理能力已大幅提升,它们有时也会过度思考,生成不必要的推理步骤,在面对不适定或含糊查询而处于不确定状态时尤其如此。我们提出有统计学原理依据的早停方法,在生成过程中监测不确定性信号以缓解这一问题。我们的第一种方法是参数化的:它将不确定性关键词的到达间隔时间建模为更新过程,并应用序贯检验来决定停止。我们的第二种方法是非参数化的,对在适定查询上过早停止的概率提供有限样本保证。我们在多个领域和多个模型的推理任务上进行了实证评估。我们的结果表明,感知不确定性的早停可以同时提升 LLM 推理的效率与可靠性,并且我们观察到数学推理的增益尤为显著。

推理模型的统计早停方法
图4:在数学推理基准上,我们提出的方法与 oracle 上界之间早停率的比较,其中不同形状和颜色分别对应不同数据集和模型。Renewal 和 Maxwise 的回归斜率分别为 0.8238 和 0.8532。