论文
ReSyn:为推理模型自主扩展合成环境
ReSyn: Autonomously Scaling Synthetic Environments for Reasoning Models
摘要
可验证奖励的强化学习(RLVR)通过利用验证器的监督,成为训练推理语言模型(RLM)的一种有前景的方法。尽管对许多任务而言实现验证器比标注解答更容易,现有合成数据生成方法仍大多以解答为中心,而基于验证器的方法则依赖少数手工构建的程序化环境。在这项工作中,我们通过引入 ReSyn 来扩展 RLVR,该流水线生成配备实例生成器与验证器的多样化推理环境,涵盖约束满足、算法谜题与空间推理等任务。用 ReSyn 数据进行 RL 训练的 Qwen2.5-7B-Instruct 模型在各推理基准和域外数学基准上取得一致提升,包括在富有挑战性的 BBEH 基准上 27% 的相对改进。消融实验表明,基于验证器的监督与更高的任务多样性都有显著贡献,为大规模生成推理环境能增强 RLM 推理能力提供了实证证据。
