论文
MAGIC:通过增量构建和密集奖励强化学习的混合粒度代理图
MAGIC: Mixed-Granularity Agent Graphs via Incremental Construction with Dense-Reward Reinforcement Learning
摘要
协作拓扑决定了基于 LLM 的多代理系统的性能和执行成本。由于任务的复杂性和所需功能不同,因此最近的方法生成特定于任务的协作图,指定代理参与和信息流。然而,代表性拓扑生成器在整个组织中使用单独的代理或预定义的组,忽略了子任务之间的不同协作需求。我们的主要见解是为每个职能角色在本地选择粒度,将细粒度控制与一个组织内可重用的协作模式相结合。学习这样的组织需要探索一个组合构造空间,其中来自最终答案奖励的中间反馈有限。因此,我们提出了 MAGIC,一种用于混合粒度图生成的密集奖励强化学习框架。具体来说,MAGIC 通过顺序选择功能角色、将其实例化为单个代理或可重用组并将其连接到现有单元来构建混合粒度代理图。我们使用当前政策下采样轨迹的回报直接优化构建政策,并使用基于潜力的奖励塑造来提供来自基于探测的效用和结构信号的中间反馈,同时保留累积任务奖励。 MAGIC 在八个基准测试中的表现优于最先进的基线,并在我们的效率研究中展示了强大的推理效率。