论文

Codebook Agent:大语言模型多智能体系统的摊销式拓扑设计

Codebook Agent: Amortized Topology Design for LLM Multi-Agent Systems

智能体系统Agent 协作

摘要

针对每个查询调整 LLM 多代理系统的通信拓扑可以提高准确性和效率,但当前的设计人员将其视为条件图生成:变分、自回归或扩散解码器搜索 $N \times N$ 邻接空间,并根据效用和结构成本(例如边计数)对采样候选进行排序的图网络代理进行训练。我们认为这种表述与问题不相符。根据经验,即使密码本容量从 8 个增长到 64 个,在奖励过滤器中幸存下来的拓扑也会崩溃为大约 6 个不同的图;边缘计数与测量的词元消耗呈负相关(Pearson $r \approx -0.4$),因此稀疏图会使推理更加昂贵;每当代理共享配置文件(已发布基准的默认配置)时,代理配置文件节点上的消息传递评分器都是邻接不变的,因此它根本无法在该机制中对候选者进行排名。这三个事实激励了 Codebook Agent:矢量量化自动编码器将成功的拓扑压缩为独立于查询的 16 项码本;奖励加权 MLP 将查询嵌入映射到代码分布; MLP 代理读取扁平邻接,根据测量的效用和每个任务的标准化词元成本进行回归,在单个批量前向传递中对最高解码候选者进行重新排名。由于测试时没有迭代搜索和消息传递,Codebook Agent 是我们比较的所有六个基准中最准确的方法(平均为 84.6,最强的先验设计者为 83.0),在 2.4 毫秒内发出拓扑,并且使用的 LLM 词元减少了 21.9--33.2%。

Codebook Agent:大语言模型多智能体系统的摊销式拓扑设计:论文配图
图1 三个地形设计系统。(Top) 每个查询都重复使用固定的地形: 零设计成本, 但没有一个图形适合每个任务 。查询条件的发电机通过一个迭接循环来调整图,每个TT步骤都对KK候选人进行抽样和评分,通常在效用和边缘计数方面有一个代理培训。(Bottom) 代码簿代理保持每个查询的适应性,并删除循环:设计空间一旦脱机,就分解为代码簿,一个查询嵌入选择代码,一个批次代用电话在基于Token 的成本目标下返回获胜者。