论文

打破奖励障碍:通过推测性探索加速思想树推理

Breaking the Reward Barrier: Accelerating Tree-of-Thought Reasoning via Speculative Exploration

模型推理推理搜索与路径规划

摘要

思想树 (ToT) 推理结构 大语言模型 (LLM) 推理作为基于树的搜索,展示了解决复杂数学和编程任务的强大潜力。然而,它的效率受到奖励依赖障碍的限制——这是由顺序奖励引导探索引起的同步瓶颈,限制了搜索并行性并引入了大量延迟。先前的系统优化主要针对线性思维链 (CoT) 推理而设计,无法解决这些挑战,导致 ToT 的效率尚未得到充分探索。为了提高 ToT 推理效率,我们观察到可以推测性地探索推理路径以打破奖励同步障碍。因此,在本文中,我们提出了 SPEX 并介绍了三种关键技术:(i)查询内推测路径选择来预测和扩展 ToT 的高潜力分支,(ii)查询间预算分配来动态平衡跨查询的推测资源分配,以及(iii)自适应提前终止来修剪倾斜搜索树的深层和冗余分支。我们在 SGLang 框架之上实现 SPEX,并通过不同的 ToT 算法和 LLM 对其进行评估。大量实验表明,SPEX 对于不同的 ToT 推理算法实现了 $1.2 \sim 3 \times$ 加速。此外,SPEX 与 词元级 推测解码 协同作用,实现高达 $4.1\times$ 的累积加速。消融研究进一步证实了每种技术的贡献。总体而言,SPEX 代表了向高效且可扩展的 ToT 推理迈出的重要一步,解锁了 LLM 高性能推理时间扩展所需的并行性。