论文

GraMRAG:通过图内存和强化学习协调多代理多步骤推理

GraMRAG: Orchestrating Multi-Agent Multi-Step Reasoning via Graph Memory with Reinforcement Learning

模型训练上下文与知识智能体系统强化学习上下文工程Agent 协作Agentic RL

摘要

尽管现有的多智能体检索增强生成(RAG)系统在复杂的多模态推理任务上表现出了良好的前景,但它们在推理深度和记忆结构方面仍然受到根本限制,在回答知识密集型问题时存在检索不足和状态盲目性的问题。为了解决这些限制,我们提出了 GraMRAG,一种图内存引导的多智能体 RAG 框架,它集成了动态多模态内存图以实现稳定的多步骤多模态推理。我们引入了一种视觉-文本桥接推理范式,将多尺度实体裁剪与 ReAct 风格的视觉工具链相结合,增强了长视野跨模态推理能力。我们进一步构建了一个多模态内存图,将代理推理形式化为动态有向无环图(DAG),显式建模动作观察依赖关系以减轻状态盲目性并抑制冗余检索。此外,我们提出了拓扑感知策略优化(TAPO),它利用图拓扑进行关键路径识别和目标节点修剪,从而实现跨多步骤推理轨迹的细粒度信用分配。对具有挑战性的多模态基准的大量实验表明,我们的方法始终优于现有基线,并在复杂的长视野推理任务上实现了最先进的性能。