论文
子搜索:复杂检索中无监督引导推理的中间奖励
SubSearch: Intermediate Rewards for Unsupervised Guided Reasoning in Complex Retrieval
摘要
大语言模型 (LLM) 本质上是概率性的,并且在使用外部信息增强时性能更可靠。由于复杂的查询通常需要对检索到的信息进行多步推理,没有明确或预定的推理路径,因此它们仍然具有挑战性。最近的方法使用强化学习对模型的结果来训练模型,显示出改善模型处理复杂信息的方式的希望。我们引入了 SubSearch,这是一个专门的框架,它从仅结果监督转变为激励规划高质量推理的中间奖励信号。与之前的过程奖励建模工作不同,之前的过程奖励建模工作重点是通过人类注释者或大型 LLM 法官的注释轨迹来训练单独的奖励模型,SubSearch 直接使用内在过程奖励(我们将其定义为内部派生的奖励)来优化生成器,消除了外部监督的需要,并转向自主信息密集型推理。对七个基准的实验表明,与仅使用结果奖励相比,用内在奖励奖励中间推理步骤可以在 QA 和多跳 QA 数据集中产生更稳健的推理轨迹。 SubSearch 可以帮助构建推理跟踪,使代理能够更好地集成搜索引擎来回答复杂的查询,同时为监督过程建模提供数据高效的替代方案。