论文
通过不确定性最小化改进推理时表现
Improving reasoning at inference time via uncertainty minimisation
摘要
大型语言模型(LLM)现在展现出强大的多步推理能力,但现有的推理时扩展方法计算成本高昂,常依赖大量采样或外部评估器。我们提出一种有原则的策略,将推理框定为不确定性最小化,并在单个思想而非token层面运作。我们的方法在每个推理步骤选择使模型自确信度最大化的延续,该指标由其内部预测分布计算得出。这种方法以少量样本取得显著改进,完全依赖模型内部信号,与多数投票等方法不同,适用于开放式问题。在MATH500和GSM8K上跨多个模型规模的实验表明,思想级自确信度最大化持续优于贪婪解码,并在可比token预算下持平或超越自洽性。跨语言评估进一步表明,该方法能稳健地迁移到高资源语言之外。此外,对自确信度动态的分析揭示,正确的推理轨迹很早收敛到稳定路径,提示早期决策——可能与推理过程的规划相关——可预测最终准确率。基于这一结果,我们表明将自确信度最大化应用于早期步骤可以解释大部分性能增益,并提供一种简单而高效的推理时扩展方法。