论文
Multi$^2$:在交互式环境中使用基于 LLM 的代理进行分层多代理决策
Multi$^2$: Hierarchical Multi-Agent Decision-Making with LLM-Based Agents in Interactive Environments
摘要
大语言模型 (LLM) 研究的中心目标是构建能够通过与动态环境的持续交互来规划、行动和适应的代理系统。虽然最近基于 LLM 的智能体表现出令人印象深刻的上下文推理,但它们的长期决策仍然脆弱,经常遭受客观漂移的影响,即目标和计划在长期交互中发生漂移。我们引入了 Multi$^2$,这是一个分层多智能体决策框架,它将智能体行为显式分解为互补角色。高级代理(系统 1)专注于使用受监督的 微调 (SFT) 生成上下文感知子目标,而底层代理(系统 2)则通过交互式环境中的离线到在线强化学习 (RL) 执行原子操作。这种分离可以实现稳定的长范围控制,减轻目标漂移,并允许有效的适应。在不同的交互环境中,Multi$^2$ 始终优于强大的代理基线,证明了多轮交互中鲁棒性和协调性的提高。除了性能之外,我们还引入并发布了三个分层基准数据集,填补了基于 LLM 的代理的训练和评估分层决策方面长期存在的空白。