论文
MARS$^2$:通过强化学习扩展多智能体树搜索以实现代码生成
MARS$^2$: Scaling Multi-Agent Tree Search via Reinforcement Learning for Code Generation
摘要
强化学习(RL)范式已在代码生成等推理密集型任务上展现出强大性能。然而,轨迹多样性有限常导致收益递减,从而限制可达到的性能上限。搜索增强RL通过引入结构化探索缓解了这一问题,但仍受制于单智能体策略先验。与此同时,利用多个相互作用的策略可以获得更多样的探索信号,但现有方法通常与结构化搜索相脱节。我们提出MARS$^2$(Multi-Agent Reinforced Tree-Search Scaling,多智能体强化树搜索扩展),一个统一的RL框架,其中多个独立优化的智能体在共享的树状搜索环境中协作。MARS$^2$将搜索树建模为可学习的多智能体交互环境,使异构智能体能够在共享搜索拓扑内协同生成并改进候选解。为支持有效学习,我们提出基于树一致奖励塑形的路径级群体优势(group advantage)公式,促进复杂搜索轨迹上的有效贡献归因。在代码生成基准上的实验表明,MARS$^2$在多样的模型组合和训练设置下均持续提升性能,证明了将多智能体协作与树搜索耦合以增强强化学习的有效性。我们的代码已在 https://github.com/TsinghuaC3I/MARTI 公开。
