论文
推理模型的统计早停方法
Statistical Early Stopping for Reasoning Models
摘要
尽管 LLM 的推理能力已大幅提升,它们有时也会过度思考,生成不必要的推理步骤,在面对不适定或含糊查询而处于不确定状态时尤其如此。我们提出有统计学原理依据的早停方法,在生成过程中监测不确定性信号以缓解这一问题。我们的第一种方法是参数化的:它将不确定性关键词的到达间隔时间建模为更新过程,并应用序贯检验来决定停止。我们的第二种方法是非参数化的,对在适定查询上过早停止的概率提供有限样本保证。我们在多个领域和多个模型的推理任务上进行了实证评估。我们的结果表明,感知不确定性的早停可以同时提升 LLM 推理的效率与可靠性,并且我们观察到数学推理的增益尤为显著。
