论文

PathRouter:在代理图检索增强生成中使奖励与检索质量保持一致

PathRouter: Aligning Rewards with Retrieval Quality in Agentic Graph Retrieval-Augmented Generation

模型训练强化学习

摘要

Agentic GraphRAG 训练语言模型代理对图结构证据进行迭代检索和推理,通过有效地导航复杂的信息网络来实现更准确和上下文感知的决策。然而,仅结果强化学习会受到 \textit{\textbf{answer-path奖励别名}}的影响,其中正确的答案可能来自捷径而不是有用的证据路径。它还表现出 \textit{\textbf{搜索更新歧义}},因为标量轨迹级反馈并不指示要调整哪些检索操作。为了减轻这些缺点,我们提出了 PathRouter,这是一种用于代理 GraphRAG 的路径感知训练框架。 PathRouter 沿着答案正确性和证据路径重叠联合评估每个轨迹,产生具有差异化 GRPO 优势缩放的四个轨迹类别,抑制捷径强化,同时保留证据寻求行为。对于缺乏证据的轨迹,冻结的金标准证据教师提供 词元级 KL 有关推理和搜索查询标记的指导,排除答案标记以避免直接响应模仿。对三种模型大小的六个 QA 基准进行的实验表明,PathRouter 持续改进了答案 F1 和证据路径重叠,与强基线相比,在 3B 模型上实现了 3.1 的平均 F1 增益,在 7B 模型上实现了 4.9 的平均 F1 增益。