论文
面向推理的协作式多代理测试时强化学习
Collaborative Multi-Agent Test-Time Reinforcement Learning for Reasoning
摘要
多代理系统已发展为许多应用中实用的LLM驱动协作者,凭借多样性与交叉校验获得鲁棒性。然而,多代理RL(MARL)训练资源密集且不稳定:共同适应的队友引发非平稳性,且奖励往往稀疏、高方差。因此,我们提出Multi-Agent Test-Time Reinforcement Learning(MATTRL),一个在推理时把结构化文本经验注入多代理审议的框架。MATTRL组建多专家团队进行多轮讨论,检索并整合测试时经验,并通过共识达成最终决策。我们还研究贡献归因以构建轮级经验池,再将其重新注入对话。在医学、数学与教育的有挑战基准上,MATTRL较多代理基线平均提升3.67%准确率,较可比单代理基线提升8.67%。消融研究检验了不同贡献归因方案,并详细比较了它们对训练结果的影响。MATTRL为分布偏移下鲁棒的多代理推理提供了稳定、有效且高效的免调优路径。
