论文

MAS-OPD:多智能体系统的按策略蒸馏

MAS-OPD: On-Policy Distillation for Multi-agent Systems

摘要

多Agent系统 (MAS) 将任务划分为多个专门角色,并且有望完成复杂的任务,但流行的方法仅依赖于推理时间编排。通用 API 成本高昂且难以定制,而带有角色提示的小型模型很少能发展出稳定的角色能力或可靠的协作,因此对 MAS 进行联合后训练至关重要。大多数尝试都使用强化学习,其团队级别的奖励未确定哪个Agent的哪一步带来了结果,而本地奖励需要根据任务重新设计。on-policy蒸馏 (OPD) 为学生采样的轨迹提供词元级别的教师监督,这是一种不需要本地奖励的更密集的信号,但对于 MAS 的相互依赖的Agent尚未得到充分探索。出现了两个困难:根据行为所属角色的判断构建互补的专业化,同时保留所有角色所需的知识,并将跨Agent协作信息转化为 OPD 可以利用的监督。我们提出了 MAS-OPD,其中角色优势专业化将角色优势定义为目标和非目标角色条件下教师信号之间的差异,协调特权归因将交互冲突归因于其来源,并将其作为特权信息单独提供给教师。对代码和数学基准的大量实验表明,MAS-OPD 在两个学生规模上都获得了最高的平均分数,并引导Agent发展出更清晰的角色专业化和更有效的协作行为。