论文

Search-GRT:面向复杂问答优化搜索Agent的引导检索训练

Search-GRT: Guided Retrieval Training of Search Agents to Optimize for Complex Question Answering

模型训练强化学习

摘要

大语言模型(LLMs)有效利用搜索引擎仍然是一个显著的挑战,特别是在复杂的多跳问答(MHQA)任务中。这些任务要求模型将问题分解为子问题,从多个来源中检索相关信息,并从多个来源中合成答案,常常导致早期阶段的检索不良导致错误累积。强化学习(RL)在提高LLMs的搜索能力方面显示出潜力,但其训练过程中常常受到稀疏奖励的阻碍,限制了模型的有效学习能力。为了解决这些问题,我们引入了引导检索训练(GRT),这是一种方法,通过使用真实信息限制RL训练期间的检索过程,从而提高搜索代理的表现。通过专注于一个精选的相关文档集,GRT为模型提供更强的学习信号,缓解了稀疏奖励的问题,并提高了模型生成准确子问题和合成正确答案的能力。我们的实验结果表明,GRT在现有方法(如Search-R1)上实现了广泛的性能改进,包括广泛的问答任务。值得注意的是,GRT在MHQA任务中表现出色,性能提高了超过40%。此外,GRT还提高了训练效率,通过较少的训练步骤实现了更好的问答性能。

Search-GRT:面向复杂问答优化搜索Agent的引导检索训练:论文配图
图1:比较 Search-R1 与本文方法的检索准确率,以及在检索正确条件下的答案准确率。图中 (a) 为检索准确率,(b) 为正确检索后的答案准确率。