论文

MARS$^2$:通过强化学习扩展多智能体树搜索以实现代码生成

MARS$^2$: Scaling Multi-Agent Tree Search via Reinforcement Learning for Code Generation

模型训练强化学习Agentic RL

摘要

强化学习(RL)范式已在代码生成等推理密集型任务上展现出强大性能。然而,轨迹多样性有限常导致收益递减,从而限制可达到的性能上限。搜索增强RL通过引入结构化探索缓解了这一问题,但仍受制于单智能体策略先验。与此同时,利用多个相互作用的策略可以获得更多样的探索信号,但现有方法通常与结构化搜索相脱节。我们提出MARS$^2$(Multi-Agent Reinforced Tree-Search Scaling,多智能体强化树搜索扩展),一个统一的RL框架,其中多个独立优化的智能体在共享的树状搜索环境中协作。MARS$^2$将搜索树建模为可学习的多智能体交互环境,使异构智能体能够在共享搜索拓扑内协同生成并改进候选解。为支持有效学习,我们提出基于树一致奖励塑形的路径级群体优势(group advantage)公式,促进复杂搜索轨迹上的有效贡献归因。在代码生成基准上的实验表明,MARS$^2$在多样的模型组合和训练设置下均持续提升性能,证明了将多智能体协作与树搜索耦合以增强强化学习的有效性。我们的代码已在 https://github.com/TsinghuaC3I/MARTI 公开。

MARS$^2$:通过强化学习扩展多智能体树搜索以实现代码生成:论文配图
图 1:MARS2 框架概述。多个代理通过基于汤普森采样的代理节点选择协作扩展共享搜索树,并通过对父级和同级信号的树一致奖励塑造来细化节点级奖励。然后,每个代理都经过独立优化,具有相对于共享树的树级组相对优势。