论文
PRISMA:面向开放域多跳问答的多Agent架构中强化学习引导的两阶段策略优化
PRISMA: Reinforcement Learning Guided Two-Stage Policy Optimization in Multi-Agent Architecture for Open-Domain Multi-Hop Question Answering
摘要
在大规模语料上回答真实世界的开放域多跳问题,是检索增强生成(RAG)系统的一项关键挑战。近期研究采用强化学习(RL)端到端地优化检索增强的推理过程,直接提升其解决复杂查询的能力。然而,可靠部署受到两个障碍的阻碍。1)检索坍缩:在缺乏推理引导规划的情况下,对大规模语料的迭代检索无法定位包含桥接答案的中间证据,导致下游推理崩溃。2)学习不稳定:端到端的轨迹训练存在推理链间贡献归因弱、模块间错误定位差的问题,导致对特定基准启发式的过拟合,限制了可迁移性和稳定性。为解决这些问题,我们提出PRISMA,一个解耦的RL引导框架,采用“规划-检索-检查-求解-记忆”(Plan-Retrieve-Inspect-Solve-Memoize)架构。PRISMA的优势在于推理引导的协作:检查器(Inspector)提供基于推理的反馈,以改进规划器(Planner)的分解和细粒度检索,同时在求解器(Solver)中强制执行基于证据的推理。我们通过两阶段群组相对策略优化(GRPO)来优化各个Agent的能力。第一阶段将规划器和求解器校准为规划与推理方面的专业专家,第二阶段利用观察感知残差策略优化(OARPO)增强检查器验证上下文并触发针对性恢复的能力。实验表明,PRISMA在十个基准上取得了最先进的性能,并可在真实场景中高效部署。
