论文

LangMARL:自然语言多智能体强化学习

LangMARL: Natural Language Multi-Agent Reinforcement Learning

智能体系统Agent 协作

摘要

大语言模型 (LLM) 智能体难以在动态环境中自主演化协调策略,很大程度上是因为粗略的全球结果掩盖了本地政策细化所需的因果信号。我们将此瓶颈确定为多智能体奖励归因问题,该问题长期以来一直在经典多智能体强化学习(MARL)中进行研究,但在基于 LLM 的系统中仍未得到充分解决。基于这一观察,我们提出了 LangMARL,一个将奖励归因和策略梯度演化从合作 MARL 引入语言空间的框架。 LangMARL 引入了代理级语言奖励归因,开创了语言空间中的梯度进化以改进策略,并从重放的轨迹中总结了与任务相关的因果关系,以提供密集的反馈并提高稀疏奖励下的收敛性。跨不同协作多智能体任务的广泛实验证明了样本效率、可解释性和强泛化性的提高。