论文

PRISMA:面向开放域多跳问答的多Agent架构中强化学习引导的两阶段策略优化

PRISMA: Reinforcement Learning Guided Two-Stage Policy Optimization in Multi-Agent Architecture for Open-Domain Multi-Hop Question Answering

模型训练强化学习RLVRAgentic RL

摘要

在大规模语料上回答真实世界的开放域多跳问题,是检索增强生成(RAG)系统的一项关键挑战。近期研究采用强化学习(RL)端到端地优化检索增强的推理过程,直接提升其解决复杂查询的能力。然而,可靠部署受到两个障碍的阻碍。1)检索坍缩:在缺乏推理引导规划的情况下,对大规模语料的迭代检索无法定位包含桥接答案的中间证据,导致下游推理崩溃。2)学习不稳定:端到端的轨迹训练存在推理链间贡献归因弱、模块间错误定位差的问题,导致对特定基准启发式的过拟合,限制了可迁移性和稳定性。为解决这些问题,我们提出PRISMA,一个解耦的RL引导框架,采用“规划-检索-检查-求解-记忆”(Plan-Retrieve-Inspect-Solve-Memoize)架构。PRISMA的优势在于推理引导的协作:检查器(Inspector)提供基于推理的反馈,以改进规划器(Planner)的分解和细粒度检索,同时在求解器(Solver)中强制执行基于证据的推理。我们通过两阶段群组相对策略优化(GRPO)来优化各个Agent的能力。第一阶段将规划器和求解器校准为规划与推理方面的专业专家,第二阶段利用观察感知残差策略优化(OARPO)增强检查器验证上下文并触发针对性恢复的能力。实验表明,PRISMA在十个基准上取得了最先进的性能,并可在真实场景中高效部署。

PRISMA:面向开放域多跳问答的多Agent架构中强化学习引导的两阶段策略优化 配图
图 2:PRISMA 映射了人类研究者在多跳问答中的工作流。左:研究者通过以下步骤处理复杂问题(例如比较来自 2021 年诺贝尔奖获奖的 TRPV1 研究与 2025 年 Spike 蛋白研究中的蛋白抑制剂):(1) 规划问题;(2) 查阅材料;(3) 通过分析证据并核查相关性进行推理;(4) 保存关键发现。右:PRISMA 用智能体复现这一过程:Planner 分解问题,Retriever 收集文档,Inspector 验证相关性与推理,Solver 综合答案,Memoize 记录已解决的子问题。当检测到问题时,有针对性的重试会闭合“检索-推理”循环。