论文

Settle:学习何时停止推理

Settle: Learning When to Stop Reasoning

模型推理解码与生成控制

摘要

推理模型通常在答案确定后继续生成。 Settle从已完成推理轨迹中的答案稳定性学习何时停止。它训练现有的推理结束标记,同时保持其他预测接近基本模型,并且在推理时仅需要普通解码。在配备 Qwen3-4B 的 MATH-500 上,Settle 将标记计数减少了 40%,准确度降低了 0.5 个百分点。在几乎相同的词元计数下,它比在第一个稳定答案时缩短的相同轨迹上的监督微调提高了 6.16 个百分点。它的停止分数预测正确答案是否会保持正确。 Settle 扩展了所评估的停止方法的准确性-词元计数帕累托前沿。