论文

PROGRESS:通过覆盖率引导的强化学习训练搜索增强LLM Agent

PROGRESS: Coverage-guided RL to Train Search-augmented LLM Agent

模型训练强化学习Agentic RL

摘要

现有的基于搜索增强的大语言模型(LLM)代理通过强化学习(Reinforcement Learning)进行训练,以提升其推理能力。然而,这些方法主要依赖于结果级别的奖励,这为搜索行为提供了很少的监督,并忽略了代理正确分解复杂查询的能力。为解决这一问题,我们提出了一种名为PROGRESS的方法,该方法利用教师指导的覆盖奖励来显式地控制策略模型生成的分解查询。在训练过程中,冻结的教师模型被用来分解复杂的查询为必要的搜索查询。这些必要的搜索查询被用来指导策略模型的搜索行为。将我们的方法集成到一个R1式训练框架中,我们的方法提供轻量级的指导,而不依赖于密集的过程级监督。实验结果表明,覆盖引导的强化学习(coverage-guided RL)在整体任务性能上有所提升,强调了在代理式LLMs中显式监督搜索策略的重要性。

PROGRESS:通过覆盖率引导的强化学习训练搜索增强LLM Agent:论文配图
图 1:该图说明了基于查询匹配信息的覆盖奖励的计算。由于粒度不匹配,策略查询 1 与任何教师查询都不匹配。然而,策略查询 2 和 3 在语义和粒度方面都与教师查询匹配。