论文

TodyComm:面向多轮 LLM 多智能体系统的任务导向动态通信

TodyComm: Task-Oriented Dynamic Communication for Multi-Round LLM-based Multi-Agent System

智能体系统模型训练强化学习Agent 协作Agentic RL

摘要

基于LLM的多轮多智能体系统依靠有效的通信结构来支持跨轮协作。然而,大多数现有方法在推理过程中采用固定的通信拓扑,这在许多实际应用中是不够的,在这些应用中,由于动态对手、任务进展或时变约束(例如通信带宽),代理的角色可能会改变\textit{跨轮}。在本文中,我们建议通过 TodyComm 来解决这个问题,这是一种 \textbf{t}ask-\textbf{o}riented \textbf{dy}namic \textbf{comm}unication 算法。它产生行为驱动的协作拓扑,适应每一轮的动态,通过策略梯度优化任务的效用。五个基准的实验表明,在动态对手和通信预算下,TodyComm 提供卓越的任务效率,同时保留token效率和可扩展性。

TodyComm:面向多轮 LLM 多智能体系统的任务导向动态通信
图1:TodyComm 训练工作流程概览。{A_i}_{i=1}^{N} 表示各智能体。给定节点特征 {f_i^t}_{i=1}^{N} 和隐藏状态 {h_i^{t-1}}_{i=1}^{N},通过 GRN 生成智能体级信用(credit){c_i^t}_{i=1}^{N},其中 t ∈ [2, T+1]。这些信用被用于采样智能体参与动作,并通过优先考虑高信用智能体之间的边,在每一轮确定性地构建通信图。