论文
Empirical-MCTS:经由双经验蒙特卡洛树搜索的连续智能体进化
Empirical-MCTS: Continuous Agent Evolution via Dual-Experience Monte Carlo Tree Search
摘要
推理时扩展策略,尤其是蒙特卡洛树搜索(MCTS),已显著增强大语言模型(LLM)的推理能力。然而,当前方法大多仍是无状态的:在每个问题实例结束后即丢弃成功的推理模式,无法模仿人类问题求解中特有的经验积累智慧。为弥合这一差距,我们提出Empirical-MCTS,一个把无状态搜索转变为连续、非参数化学习过程的双循环框架。该框架通过两个新机制统一局部探索与全局记忆优化:成对经验进化元提示(Pairwise-Experience-Evolutionary Meta-Prompting, PE-EMP)与记忆优化智能体(Memory Optimization Agent)。PE-EMP在局部搜索中充当反身式优化器,利用成对反馈动态合成自适应准则并实时进化元提示(系统提示)。与此同时,记忆优化智能体把一个全局仓库作为动态策略先验加以管理,通过原子操作跨问题蒸馏高质量洞见。在AIME25、ARC-AGI-2与MathArena Apex等复杂推理基准上的大量评估表明,Empirical-MCTS显著优于无状态MCTS策略与独立的经验驱动智能体。这些结果凸显了把结构化搜索与经验积累相耦合,对于掌握复杂开放式推理任务的关键必要性。
