论文
MARL-GPT:多智能体强化学习基础模型
MARL-GPT: Foundation Model for Multi-Agent Reinforcement Learning
摘要
多智能体强化学习(MARL)的最新进展已在众多具有挑战性的领域和环境中取得成功,但通常需要为每个任务训练专门的模型。在这项工作中,我们提出一套连贯的方法,使单个基于GPT的模型能够在多样的MARL环境与任务中学习并表现出色,包括StarCraft Multi-Agent Challenge、Google Research Football和POGEMA。我们的方法MARL-GPT采用离线强化学习,在海量专家轨迹上规模化训练(SMACv2为400M、GRF为100M、POGEMA为1B),并结合一个无需任务特定调优的单一基于transformer的观测编码器。实验表明,MARL-GPT在所有测试环境中均取得与专门化基线相当的性能。因此,我们的发现表明,为种类繁多(且差异显著)的多智能体问题构建多任务transformer模型确实是可行的,为通往MARL基础模型(类似于自然语言建模中的ChatGPT、Llama、Mistral等)铺平了道路。
