论文

SRPO:多Agent LLM的集合级相对策略优化

SRPO: Setwise Relative Policy Optimization for Multi-Agent LLMs

模型训练强化学习Agentic RL

摘要

多智能体大语言模型通过在共享环境中协调多个策略来解决复杂的任务。然而,现有的强化学习方法通常单独优化每个响应或轨迹,即使多个输出共同导致一个状态转换也是如此。因此,更新单元与系统执行的动作不同。为了解决这个问题,我们提出了 SRPO(集合相对策略优化),它将活动集(一次转换消耗的最小输出集)视为一个多智能体动作。具体来说,SRPO 将成员对数比率组合成一个基数归一化集合比率,分配一个相对优势,并对该集合进行一次剪辑。这种表述将分工和联合共同进化统一为具有不同集合大小的动作。数学推理和多轮搜索实验展示了一种跨四种模型规模的固定、混合和动态路由工作流程的训练界面,在报告的比较中具有最强的宏观平均结果。优化诊断进一步表征了其在不同事件减少和集合大小下的稳定性。