论文
用多智能体Actor-Critic学习去中心化LLM协作
Learning Decentralized LLM Collaboration with Multi-Agent Actor Critic
摘要
最近的工作探索了通过多智能体强化学习(MARL)优化大语言模型协作。然而,大多数 MARL 微调方法依赖于预定义的执行协议,这通常需要集中执行。去中心化的 LLM 协作在实践中更具吸引力,因为代理可以与灵活的部署并行运行推理。此外,当前的方法使用蒙特卡罗方法进行微调,其方差较高,因此需要更多样本才能有效训练。 Actor-Critic 方法在 MARL 中普遍用于处理这些问题,因此我们开发了多智能体 Actor-Critic (MAAC) 方法来优化去中心化的 LLM 协作。在本文中,我们分析了这些 MAAC 方法何时以及为何有益。我们提出了 2 种 MAAC 方法,即具有 \textbf{C} 集中式 \textbf{C}ritic 的 \textbf{CoLLM-CC} 和具有 \textbf{D} 分散式 \textbf{C}ritic 的 \textbf{CoLLM-DC}。我们在写作、编码和游戏领域的实验表明,蒙特卡洛方法和 CoLLM-DC 在短时限和密集奖励设置中可以实现与 CoLLM-CC 相当的性能。然而,它们在长视野或稀疏奖励任务上的表现均低于 CoLLM-CC,其中蒙特卡洛方法需要更多的样本,而 CoLLM-DC 难以收敛。我们的代码位于 https://github.com/OpenMLRL/CoMLRL/releases/tag/v1.3.2。
