论文
DLM:用于离线多智能体顺序决策的统一决策语言模型
DLM: Unified Decision Language Models for Offline Multi-Agent Sequential Decision Making
摘要
从离线数据集中构建可扩展且可重用的多智能体决策策略仍然是离线多智能体强化学习(MARL)中的一个挑战,因为现有方法通常依赖于固定的观察格式和限制泛化的行动空间。相比之下,大语言模型 (LLM) 提供灵活的建模接口,可以自然地适应异构观察和操作。受此启发,我们提出了决策语言模型(DLM),它将多智能体决策制定为集中训练和分散执行范式下的对话式序列预测问题。 DLM 分两个阶段进行训练:受监督的 微调 阶段,利用对话式数据集进行代理间上下文的集中训练,并从离线轨迹生成可执行动作,然后是组相对策略优化阶段,通过轻量级奖励函数增强对分布外动作的鲁棒性。多个基准的实验表明,统一的 DLM 优于强大的离线 MARL 基线和基于 LLM 的对话决策方法,同时展示了对跨任务中未见过的场景的强大的零样本泛化能力。