论文
超越固定预算:刻画思维树推理策略的非弹性与局限
Beyond Fixed Budgets: Characterizing the Inelasticity and Limitations of Tree-of-Thought Reasoning Strategies
摘要
思维树(ToT)搜索已成为提升大语言模型推理能力的一个有前景的方向,但在实践中部署这些方法引出一个鲜受系统性关注的问题:不同搜索策略在变化的算力预算、模型规模与问题难度下表现如何?在本工作中,我们在两个数学推理基准(Math500和GSM8K)、两个模型规模(Llama-3B和Llama-8B)和四个token预算(3k-10k)下评估了两种代表性ToT方法:基于蒙特卡洛树搜索的DPTS与基于语义去重的SSDP。我们的分析揭示,两种方法表现出方向相反的局限。DPTS在低预算下存在冷启动瓶颈:其价值估计需要足够探索后才变得可靠,因此尽管在更高预算下扩展行为强劲,却难以适配资源受限的场景。另一方面,SSDP能高效得到候选解,但容易出现前沿耗竭;其激进的节点合并会永久丢弃未探索的路径,使其无论剩余多少预算都无法继续改进。综合来看,这些发现表明,在整个计算连续区间上,固定的探索策略与固定的剪枝策略都不足以胜任。我们认为,面向科学推理智能体的有效搜索需要能根据搜索进度与可用资源调整自身行为的策略。