论文

AgenticRag-R1:具有堆栈内存的代理强化学习,用于多步骤推理、检索和记忆

AgenticRag-R1: Agentic Reinforcement Learning with Stack Memory for Multi-Step Reasoning, Retrieval and Memorizing

模型训练强化学习

摘要

检索增强生成 (RAG) 提高了 大语言模型 (LLM) 的真实性,但现有的 RAG 系统常常难以应对复杂的多步骤推理,需要自适应检索和中间上下文的连续修订。最近基于强化学习 (RL) 的代理 RAG 方法部分缓解了这个问题,但通常依赖于粗粒度的动作空间和轨迹级奖励,导致奖励分配较弱,并且偏向短期、刻板的推理模板。为了解决这个问题,我们提出了 AgenticRag-R1,这是一个 RL 框架,它通过内存堆栈和细粒度动作空间深度集成推理、检索和记忆,并由分层动作感知奖励和信息感知轨迹拒绝策略支持,以实现有效的长视野学习。跨多种多跳、开放域和代理推理基准、跨越多个骨干模型大小的实验表明,AgenticRag-R1 始终优于强大的基准。此外,AgenticRag-R1 学习更鲁棒、可解释和记忆感知的推理行为,突出了细粒度动作建模和信息感知优化对长视野推理的影响。我们的代码是匿名的,可在 https://github.com/jianxinke/Harness-RL/tree/AgenticRAG-R1-Whitebox 获取。