论文
GTA-RAG:用于多轮检索增强推理的图轨迹增强强化学习
GTA-RAG: Graph-Trajectory-Augmented Reinforcement Learning for Multi-Turn Retrieval-Augmented Reasoning
摘要
检索增强生成 (RAG) 使 LLM 能够访问外部知识来回答知识密集型问题。对于复杂的多跳问题,多轮检索增强推理将 RAG 扩展为迭代过程,在文档中重复搜索和集成证据。然而,现有的代理 RAG 强化学习 (RL) 方法通常通过最终答案奖励进行优化,从而提供稀疏监督并忽略模型是否真正检索到所需的证据链。我们提出了 \textsc{GTA-RAG},一种用于多轮检索增强推理的图轨迹增强强化学习框架。从实体-文档图中,我们对连接的文档路径进行采样,合成多跳 QA 轨迹,并使用部署的 检索器 对其进行验证,以获得可执行的轨迹级监督。然后,我们使用组相对策略优化(GRPO)和轨迹引导奖励来优化检索策略,以鼓励准确答案和获取目标证据文档,然后对自然 QA 实例进行答案奖励训练。对三个多跳和两个简单 QA 基准的实验表明,\method{} 始终优于具有 Qwen2.5-3B 和 Qwen2.5-7B 主干的基于 RL 的 RAG 基线,同时大幅提高了证据链覆盖率。我们的代码可在 https://github.com/cjcj46262/GTA-RAG 获取。