论文
大语言模型 早决定,晚解释
Large Language Models Decide Early and Explain Later
摘要
大语言模型 通常通过生成长的中间思想链推理来实现强大的性能。然而,尚不清楚模型的最终答案何时在生成过程中实际确定。如果答案在中间阶段已经确定,后续的推理标记可能会构成决策后解释,从而增加推理成本和延迟,而不会提高正确性。我们使用强制答案完成来研究预测答案在推理步骤中的演变,这引发了模型在部分推理前缀处的中间预测。重点关注 Qwen3-4B 并对所有考虑的数据集的结果进行平均,我们发现预测答案仅在 32% 的查询中发生变化。此外,一旦发生最终答案切换,模型每个查询平均生成 760 个额外推理标记,占总推理预算的很大一部分。受这些发现的启发,我们研究了早期停止策略,一旦答案稳定就停止生成。我们证明,简单的启发式方法(包括基于探测的停止)可以将每个查询的推理词元使用量减少 500 个词元,而准确率仅下降 2%。总之,我们的结果表明,思想链生成的很大一部分是多余的,可以在对性能影响最小的情况下减少。