论文

学会构建环境:通过可验证环境合成实现自演化推理RL

Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis

模型训练强化学习RLVR

摘要

我们追求一种自我改进语言模型的愿景:模型不再只是生成问题或可供模仿的轨迹,而是构建训练自身的环境。在零数据推理RL中,这将自我改进从数据生成循环重构为环境构建循环,其中每个产物都是可复用的可执行对象,负责采样实例、计算参考答案并给响应打分。这一愿景能否持续带来提升取决于单一性质:环境必须呈现稳定的求解—验证不对称性,即模型能够一次性写出判定程序,却无法在自然语言中对全新实例可靠地执行它。这种不对称性有两种互补的形式。有些任务用算法推理很难,但作为代码却很轻松:动态规划或图遍历程序只需编译一次,就能产出无限多的经过校准的实例。另一些任务本质上难求解但易验证,例如植入解的子集和或约束满足问题。两者都在提出与求解之间造成持久的鸿沟,策略无法通过钻验证器的空子来消除它,而正是这一鸿沟在学习者进步时仍让奖励保持信息量。我们将这一观点实例化为EvoEnv,一种单策略的生成器—求解器方法,从十个种子合成Python环境,且只有经过分阶段验证、语义自审、相对求解器的难度校准与新颖性检查后才予以采纳。最有力的证据来自已经很强的模型区间:在Qwen3-4B-Thinking上,固定的公开数据RLVR和固定的人工设计环境RLVR都会拉低平均分,而EvoEnv将其从72.4提升到74.8,相对增益3.3%。我们认为,稳定的自我改进不在于生成更多合成数据,而在于模型学会构建难度在结构上始终超出自身能力所及的世界。

学会构建环境:通过可验证环境合成实现自演化推理RL:论文配图
图 1:EvoEnv 概述。单个策略生成可重用的可执行环境并解决从接受池中采样的新实例。候选环境仅在验证、语义审查、求解器相关难度校准和新颖性过滤之后才进入池。