论文
通过多Agent偏好学习改善LLM协作
Improving LLM Collaboration via Multi-Agent Preference Learning
摘要
一些作品探索了LLM合作中的多智能体强化学习(MARL)。然而,在实践中构建可靠的奖励很困难,因为完整而准确的指标通常不可用且难以汇总。偏好学习提供了一种通过比较人类或人工智能反馈进行学习的替代方案。然而,其向多智能体系统的扩展仍未得到充分探索。为了解决这一差距,我们从分散和集中协作的角度制定了基于偏好的多Agent系统(MAS)。我们还引入了通用的多智能体偏好学习框架(MAPL)来解决这些问题。 MAPL 允许通过将当前解决方案与各种Agent生成的分散式或集中式解决方案进行比较来进行迭代更新。我们使用来自人类反馈的 MARL (MARLHF) 以及学习奖励模型和多智能体直接偏好优化 (MADPO) 来实例化 MAPL。关于协作写作、编码、工具使用和旅行计划的实验表明,MAPL 可以提高协作质量和效率,同时通过固定、明确的奖励接近 MARL 的性能。在 MAPL 中,MARLHF 在大多数任务上通常优于 MADPO,但对数据覆盖、Agent和比较器模型以及底层 MARL 算法仍然敏感。