论文

面向推理的协作式多代理测试时强化学习

Collaborative Multi-Agent Test-Time Reinforcement Learning for Reasoning

智能体系统模型训练强化学习Agent 协作Agentic RL

摘要

多代理系统已发展为许多应用中实用的LLM驱动协作者,凭借多样性与交叉校验获得鲁棒性。然而,多代理RL(MARL)训练资源密集且不稳定:共同适应的队友引发非平稳性,且奖励往往稀疏、高方差。因此,我们提出Multi-Agent Test-Time Reinforcement Learning(MATTRL),一个在推理时把结构化文本经验注入多代理审议的框架。MATTRL组建多专家团队进行多轮讨论,检索并整合测试时经验,并通过共识达成最终决策。我们还研究贡献归因以构建轮级经验池,再将其重新注入对话。在医学、数学与教育的有挑战基准上,MATTRL较多代理基线平均提升3.67%准确率,较可比单代理基线提升8.67%。消融研究检验了不同贡献归因方案,并详细比较了它们对训练结果的影响。MATTRL为分布偏移下鲁棒的多代理推理提供了稳定、有效且高效的免调优路径。

面向推理的协作式多代理测试时强化学习
图1:MATTRL 总览。图中以医学诊断作为贯穿示例,但该框架是领域通用的。数学与教育领域的实例化见 Appendix B.1 与 C.1。