论文

ReSyn:为推理模型自主扩展合成环境

ReSyn: Autonomously Scaling Synthetic Environments for Reasoning Models

模型训练强化学习合成数据RLVR

摘要

可验证奖励的强化学习(RLVR)通过利用验证器的监督,成为训练推理语言模型(RLM)的一种有前景的方法。尽管对许多任务而言实现验证器比标注解答更容易,现有合成数据生成方法仍大多以解答为中心,而基于验证器的方法则依赖少数手工构建的程序化环境。在这项工作中,我们通过引入 ReSyn 来扩展 RLVR,该流水线生成配备实例生成器与验证器的多样化推理环境,涵盖约束满足、算法谜题与空间推理等任务。用 ReSyn 数据进行 RL 训练的 Qwen2.5-7B-Instruct 模型在各推理基准和域外数学基准上取得一致提升,包括在富有挑战性的 BBEH 基准上 27% 的相对改进。消融实验表明,基于验证器的监督与更高的任务多样性都有显著贡献,为大规模生成推理环境能增强 RLM 推理能力提供了实证证据。

ReSyn:为推理模型自主扩展合成环境
图1:ReSyn 数据流水线中合成环境生成的概览。LLM 以种子关键词作为提示来合成推理环境的 Python 实现,每个环境定义实例生成 ρ 0 \rho_{0} 、观测 O O 与奖励 R R 。生成的环境由 LLM 评判者(LLM judge)评估。通过评估的环境被加入 ReSyn 数据集,而未通过的环境则根据反馈进行修改并重新评估