论文

HyperMCTS:用于长期 LLM Agent的超图增强 MCTS

HyperMCTS: Hypergraph-Augmented MCTS for Long-Horizon LLM Agents

智能体系统Agent 规划

摘要

长期任务需要大语言模型 (LLM) Agent在跨越整个解决方案的约束下协调决策。蒙特卡洛树搜索 (MCTS) 通过探索替代动作轨迹,提供了一种很有前景的测试时计算扩展方法,但模型计算和环境交互使得搜索成本高昂。因此,有效的搜索需要有效地重用轨迹反馈。标准 MCTS 维护特定于前缀的统计数据,而无需明确累积跨不同路径重复出现的决策组的结果。为了填补这一空白,我们提出了 HyperMCTS,这是一种无需训练的方法,可以使用交叉轨迹超图来增强有序 MCTS 树。超边代表规范决策组,并在当前任务中累积观察到的回报。我们的超图引导的 HyperUCT 选择规则将重叠超边的证据聚合到先验操作中,允许在一个前缀下收集的结果通知另一个前缀下的选择,同时保留树中的执行历史记录。在 DeepPlanning 上,HyperMCTS 将三个骨干模型的平均规划精度比最强基线提高了 2.3--7.3 个百分点。它使 Qwen3.6-27B 在购物规划方面优于 Claude Opus 4.6(最大值),同时与评估的基于 MCTS 的基线相比,以更少的 LLM 调用和输出词元实现更高的准确性。 SealQA 实验进一步证明了问答方面的改进。