论文
用于高效多智能体通信拓扑设计的奖励引导自回归图生成
Reward-Guided Autoregressive Graph Generation for Efficient Multi-Agent Communication Topology Design
摘要
基于LLM的多智能体系统(MAS)通过协调多个智能体在复杂推理任务上实现了强大的性能,但代价是大量的词元消耗。最近关于自动拓扑设计的工作 ARG-Designer 已将这个问题重新定义为自回归图生成。然而,其训练目标没有为模型生成稀疏且高效的拓扑提供明确的激励。我们通过引入受人类反馈强化学习 (RLHF) 启发的奖励引导自回归图生成 (RGA-Designer) 来解决此限制。我们训练一个联合捕获任务正确性和结构紧凑性的奖励模型,然后使用奖励模型作为反馈来微调预训练的图生成器。我们的方法保持了 ARG-Designer 水平的任务准确性,同时平均减少了 20.5% 的词元消耗。