论文

超越奖励工程:长上下文强化学习的数据配方

Beyond Reward Engineering: A Data Recipe for Long-Context Reinforcement Learning

模型训练合成数据

摘要

长上下文推理是 大语言模型 的一项基本功能,特别是当它们被部署为必须对长轨迹进行推理的自主代理时。强化学习(RL)最近已成为提高这种能力的主导范例,但现有的工作主要集中在奖励工程上,而多样化的训练数据仍然稀缺。我们从以数据为中心的角度重新审视这个问题,并表明,仅简单而有效的数据配方,再加上基于最小结果的 GRPO 设置,就足以显着改善长上下文推理。我们的方案针对三个互补的任务系列——检索、多证据综合和推理——为此我们构建和整理了八个数据集,总计约 14K 个示例。三个模型 (Qwen3-4B/8B/30B-A3B) 的实验在七个长上下文基准上产生了 +7.2/+3.2/+6.4 点的平均增益,超过了之前的 RL 训练集。我们进一步证明,这些收益转移到了代理任务中,其中使用我们的数据配方对代理调整模型进行持续强化学习将 GAIA 提高了 4.8 点,将 BrowseComp 提高了 7.0 点。我们将发布我们的数据集以促进未来的研究。