论文

GRASP:面向智能体RAG的粒度感知搜索策略

GRASP: GRanularity-Aware Search Policy for Agentic RAG

模型训练强化学习Agentic RL

摘要

智能体检索增强生成(RAG)扩展静态RAG:允许语言模型迭代推理、生成搜索查询、检索证据并预测答案。但模型仍难决定何时检索、该用词法匹配还是语义相似、以及如何控制上下文粒度以防无关token干扰智能体推理。本文提出GRASP:一个强化学习框架,训练智能体在多步推理中自适应协调互补的检索工具。GRASP为智能体提供语义搜索、关键词搜索与段落阅读动作,使其检索句级证据、仅在需要时扩展上下文。策略以联合考虑答案准确率、落地阅读、互补搜索与轮次效率的奖励训练。多跳推理基准上的实验显示:GRASP相对单步检索、基于提示的智能体RAG与基于RL的检索基线,同时提升检索召回与下游问答表现。定性消融分析显示学到的策略发展出可解读的浏览与扫描行为:用语义搜索做广度探索、段落阅读做局部核验、关键词搜索找实体专属证据。结果表明学会协调检索信号与上下文粒度,对智能体正确推理至关重要。

GRASP:面向智能体RAG的粒度感知搜索策略:论文配图
图 1:示例说明为什么仔细控制上下文对于多跳推理至关重要。尽管有足够的证据,单步推理仍会失败,因为不相关的内容会分散模型的注意力,而多步推理则通过检索不相关的文档并产生误导性的联系来加剧错误。