论文
LLawCo:学习合作法则以建模具体的多智能体行为
LLawCo: Learning Laws of Cooperation for Modeling Embodied Multi-Agent Behavior
摘要
近年来,在去中心化和部分可观察的环境中运行的实体代理引起了越来越多的关注。然而,现有的基于 大语言模型 (LLM) 的智能体经常表现出与其伙伴不一致或与环境状态不一致的行为,导致合作效率低下和任务成功率低。为了应对这一挑战,我们提出了一个新颖的框架,即学习合作法则(LLawCo),它使实体主体能够自主地与其合作伙伴和任务目标保持一致。我们的框架允许代理反思过去的失败,以提取不一致的行为模式,这些模式用于导出高级行为法则,例如“必要时交谈”和“等待合作伙伴”。这些法则通过受监督的 微调 明确地纳入智能体的思维链中,使它们的推理与任务要求和其他智能体的行为保持一致。为了评估我们的方法,我们引入了 PARTNR-Dialog,这是一个构建在 PARTNR 环境上的大规模多智能体通信和合作规划基准。对现有任务和我们的新基准的实验表明,合作效率和任务成功率显着提高。在四个主干 LLM 中,与最先进的开源通信代理框架相比,我们的方法在 PARTNR-Dialog 基准上的平均成功率提高了 4.5%,在 TDW-MAT 基准上的平均成功率提高了 6.8%。有关详细信息,请参阅 LLawCo 项目页面:https://www.merl.com/research/highlights/LLawCo