论文

ReM-MoA:推理记忆支撑智能体混合的扩展

ReM-MoA: Reasoning Memory Sustains Mixture-of-Agents Scaling

上下文与知识记忆Agent记忆

摘要

智能体混合(MoA)架构通过把多个LLM智能体组织成分层推理管线改进推理时扩展。但既有MoA变体随深度增加无法维持增益——表现出退化、早期平台或饱和。我们提出ReM-MoA——记忆增强的MoA框架——经两种机制维持扩展:(1) 排名推理记忆——用比较型评审智能体持久存储并排序来自所有层的推理踪迹;(2) 策展多样化记忆路由——让不同智能体接触成功与失败踪迹的不同组合——在传播高质量推理的同时保持探索多样性。我们进一步引入可选的多域评审蒸馏管线——经前沿模型监督改进排序质量。跨数学、形式逻辑、代码、知识与常识五个推理基准——ReM-MoA在深度与宽度扩展上都持续超越先前MoA变体——且优势随深度扩大——确立结构化跨层推理记忆为可扩展多智能体推理的关键缺失机制。

ReM-MoA:推理记忆支撑智能体混合的扩展:论文配图
图 2:ReM-MoA 框架。在每一层,NN 提议者代理生成推理轨迹 rl,jr_{l,j},审阅者代理对它们进行比较并分配每条轨迹分数 sl,js_{l,j} 和基本原理 ρl,j\rho_{l,j},提交给排名推理内存 ℳ\mathcal{M}。从第 22 层开始,每个提议者智能体都会收到来自 ℳ\mathcal{M} 的精选参考集,该参考集来自三个系列:Topn\text{Top}_{n}(最高得分轨迹)、Botn\text{Bot}_{n}(最低得分)或 Conn\text{Con}_{n}(对比、 Topa∪Botb\text{Top}_{a}\cup\text{Bot}_{b})。