论文
重新审视LLM的树搜索:用Gumbel与Sequential Halving实现预算可扩展的推理
Revisiting Tree Search for LLMs: Gumbel and Sequential Halving for Budget-Scalable Reasoning
摘要
神经树搜索是一种强大的决策算法,广泛应用于博弈和基于模型的强化学习等复杂领域。近期工作将AlphaZero式树搜索用于增强大语言模型(LLM)推理阶段的能力,但我们发现该途径存在尺度失效问题:在GSM8K和Game24上,准确率随搜索预算的增加而下降。本文提出ReSCALE,一种对Gumbel AlphaZero MCTS的改造,用Gumbel采样和Sequential Halving替换Dirichlet噪声与PUCT选择,在不改动模型及其训练的情况下恢复了单调的预算扩展特性。在基线出现性能退化的预算下,ReSCALE在GSM8K上达到58.4\%,在Game24上达到85.3\%。消融实验证实Sequential Halving是这一改进的主要驱动力。