论文
OThink-SRR1:通过 大语言模型 的强化学习进行搜索、细化和推理
OThink-SRR1: Search, Refine and Reasoning with Reinforced Learning for Large Language Models
摘要
检索增强生成 (RAG) 扩展了 大语言模型 (LLM) 的知识,但当前的静态检索方法难以解决复杂的多跳问题。虽然最近的动态检索策略提供了改进,但它们面临两个关键挑战:1)不相关的检索噪声可能会误导推理过程,2)处理完整文档会产生过高的计算和延迟成本。为了解决这些问题,我们提出了 OThink-SRR1,这是一个框架,通过强化学习训练的迭代搜索-细化-推理过程来增强大型模型。其核心 Refine 阶段在推理之前将检索到的文档提炼为简洁、相关的事实。我们引入了 GRPO-IR,一种端到端的强化学习算法,它奖励准确的证据识别,同时惩罚过度的检索,从而训练模型既专注又高效。对四个多跳 QA 基准的实验表明,我们的方法在使用更少的检索步骤和标记的同时,比强基线实现了更高的准确性。这使得 OThink-SRR1 成为信息寻求代理的有效基础模型。