论文

分工与合作:使用跨智能体学习信号进行角色分解的多智能体 LLM 训练

Divide and Cooperate: Role-Decomposed Multi-Agent LLM Training with Cross-Agent Learning Signals

模型训练强化学习

摘要

执行多步推理的现代语言智能体在知识密集型问题回答中表现出了强大的性能。然而,现有方法通常将证据获取和答案生成结合在单个策略中。这迫使单一模型扮演多个潜在冲突的角色,导致政策空间的组合爆炸并阻碍有效的探索。它还在训练过程中引入了贡献分配问题:当生成失败时,检索到足够证据的搜索操作仍可能受到惩罚,反之亦然。我们提出了 DAC(划分与合作),这是一种角色分解的多智能体训练框架,它将智能体搜索分为两个协作子任务,每个子任务都由一个经过角色特定学习信号训练的专用智能体处理。生成器充当答案生成者和证据充分性验证者的双重角色,当检索到的证据不足时放弃。该弃权信号被纳入搜索代理的奖励中,提供结构化的跨代理学习信号,从而改善贡献分配。相反,搜索者通过硬阳性证据增强将生成器暴露在多样化且具有挑战性的证据环境中,从而提高其稳健性。通用和多跳 QA 基准测试表明,通过共享主干上参数高效的 LoRA 模块实现的 DAC,与依赖于完整模型的 微调 的先前基准相比,实现了强大的性能。