论文
ASPO:用子结构奖励学习多Agent协作流程
Multi-Agent System Search via Active Substructure-aware Policy Optimization
摘要
LLM 使多Agent系统 (MAS) 能够处理复杂的任务,但手动设计Agent角色、提示和通信结构需要大量的专业知识和精力。这激发了学习策略,从执行奖励构建特定于查询的 MAS。现有方法通常通过重复遍历一组固定的训练查询并在工作流级别分配奖励来训练这些策略。然而,这忽略了查询不断发展的学习潜力的差异,并掩盖了哪些子结构可以提高解决方案的质量。在本文中,我们提出了主动子结构感知策略优化(ASPO),这是一种用于查询级 MAS 搜索的 RL 框架。 ASPO 引入了自适应查询选择机制 (AQSM),该机制侧重于策略能力边界上的查询训练:那些它可以解决但尚未可靠地解决的问题。互补的发现机制拓宽了硬查询的架构探索,有助于区分探索不足和操作员能力限制。除了查询选择之外,ASPO 还引入了子结构级别的奖励,用于衡量每个操作的后代子图中的输出质量增益。这些奖励指导近端策略优化,以加强有用的架构改进并阻止冗余或有害的计算。这些机制共同优先考虑可学习的查询,并为学习有效的 MAS 提供细粒度的反馈。在涵盖数学推理、一般问题解答和代码生成的六个基准测试中,ASPO 在每个基准测试中均排名第一(与 12 个基准相比)。