论文
$S^3$-R1:学习使用合成数据逐步检索和回答
$S^3$-R1: Learning to Retrieve and Answer Step-by-Step with Synthetic Data
摘要
强化学习 (RL) 后训练 在模型中启用了更新的功能,例如使用代理工具进行搜索。然而,这些模型的困境主要是由于基于结果的奖励稀疏以及缺乏包含不同硬度问题的训练数据的限制,这导致模型无法使用收集问答证据的工具进行更深入的搜索。为了解决这些限制,我们引入了 S^3-R1(合成数据和稳定搜索 R1),这是一个将以数据为中心的方法与更密集的学习信号相结合的框架。我们首先开发一个综合生成和管理管道,以编程方式从现有文档中派生出各种多跳问题。该管道包含基于检索的验证步骤,以专门隔离中等难度的问题。然后,我们将这个扩展的训练集与奖励结构配对,该奖励结构评估中间搜索质量和最终答案的正确性。这种设置直接缓解了稀疏奖励固有的贡献分配问题。我们的评估表明,S^3-R1 通过学习更有效的搜索和合成策略,优于现有基线,在域外数据集上的稳健泛化方面提高了 10%。