论文
将小型LLM训练为空间多智能体策略
Training Small LLMs as Spatial Multi-Agent Policies
摘要
通过多智能体强化学习训练基于 LLM 的多智能体系统正在迅速获得关注,并且并行的工作线认为,应该根据它们的行为来判断此类系统,而不仅仅是它们的奖励。我们在空间合作游戏中使用这两个线程,其中通过底层操作提示的小型冻结 LLM 彻底失败,获得零奖励。在选项/半 MDP 框架的指导下——并且,因为选项执行在代理之间是异步的,所以它在宏动作 Dec-POMDP 中的多代理扩展——我们为每个游戏配备了符号 \emph{options} 库:由符号规划器执行的类型化、状态可行、短期行为。每个库都是由游戏源代码中的前沿编码模型起草的;然后,过滤每个菜单的可行性守卫是从廉价的随机策略预演中机械合成的——只有当守卫解释了重复的执行失败同时隐藏没有记录的成功时,才会采用守卫——因此没有守卫是手工创作、选择或奖励调整的。每个代理的 LLM 充当其选项策略,具有由多代理 GRPO (PA-MAGRPO) 的每个代理变体训练的私有每个代理 LoRA 适配器;这将冻结的基地从零奖励提升到能够在三场比赛和四个小骨干中进行比赛。然后,行为审计揭示了奖励和合作脱钩:奖励曲线上升可能仅仅意味着一个智能体已经学会了在其合作伙伴闲置时独自运行整个任务——只有当任务需要时才会出现合作。因此,仅用奖励来衡量合作是不可靠的。行为评估必须与之并存。