论文

STRIDE:面向检索增强多跳问答的策略性迭代决策

STRIDE: Strategic Iterative Decision-Making for Retrieval-Augmented Multi-Hop Question Answering

智能体系统Agent 规划Agent Harness

摘要

多跳问答(MHQA)通过检索并推理分散在多个文档中的证据,实现对复杂查询的准确回答。现有MHQA方法主要依赖迭代式检索增强生成,存在以下两大问题。1)现有方法过早地锁定表层实体而非底层推理结构,使问题分解极易受词汇歧义影响。2)现有方法忽视推理步骤之间的逻辑依赖,导致执行不协调。为解决这些问题,我们提出STRIDE,一个将战略规划、动态控制与落地执行相分离的框架。其核心是元规划器(Meta-Planner)先构建与实体无关的推理骨架以捕捉查询的抽象逻辑,从而将实体落地推迟到推理结构建立之后,缓解过早词汇锁定导致的消歧错误。随后监督者(Supervisor)以依赖感知的方式编排子问题执行,在可能时高效并行、必要时按序协调。通过动态决定是检索新证据还是从已有事实推理,它避免冗余查询与错误传播,同时融合跨分支信息并重述失败的查询以增强鲁棒性。落地的事实抽取与逻辑推理被委派给专门的执行模块,通过检索与推理的显式分离确保忠实性。我们进一步提出STRIDE-FT,一个模块化微调框架,使用STRIDE自生成的执行轨迹,既不需要人工标注也不需要更强的教师模型。实验表明STRIDE实现了稳健而准确的推理,而STRIDE-FT有效增强了开源LLM。

STRIDE:面向检索增强多跳问答的策略性迭代决策:论文配图
图 1. 当前迭代 RAG 面临的挑战。上图:由于词汇歧义,过早的实体基础导致级联错误。底部:严格的调度无法考虑子问题之间丰富的依赖结构。