论文

Scaling the Scaling Logic:逻辑推理的Agentic元合成

Scaling the Scaling Logic: Agentic Meta-Synthesis of Logic Reasoning

模型训练强化学习合成数据RLVR

摘要

扩展可验证的训练信号仍然是可验证奖励强化学习(RLVR)的一个关键瓶颈。逻辑推理是一个自然的基础:约束是正式的,答案是可以通过编程检查的。然而,先前的综合管道要么依赖于专家编写的代码,要么在固定的模板/框架内运行,这在很大程度上限制了实例级扰动的增长。我们提出了 SSLogic,一种代理元综合框架,通过在封闭的生成-验证-修复循环中迭代综合和修复可执行的生成器-验证程序对,在任务族级别上进行扩展,从而以可控的难度实现连续的族演化。为了确保可靠性,我们引入了多门验证协议,该协议将多策略一致性检查与对抗性盲审相结合,其中独立代理必须通过编写和执行代码来过滤不明确或不适定的任务来解决实例。从 400 个种子家族开始,两轮进化扩展到 953 个家族和 21,389 个可验证实例(之前为 5,718 个)。在匹配的训练步骤中,对 SSLogic 演化数据进行训练可在种子基线上产生一致的增益,将 SynLogic 提高 +5.2,将 BBEH 提高 +1.4,将 AIME25 提高 +3.0,将 Brumo25 提高 +3.7。

Scaling the Scaling Logic:逻辑推理的Agentic元合成
图2:Multi-Gate Agentic Meta-Synthesis Framework 概览。Main Agent 以三阶段闭环运行:任务合成(Phase I)、经由 Quality Agent Gates 的筛选与基于共识的验证(包括盲审)(Phase II),以及针对失败的溯因调试与经验更新,最终交付 Generators/Validators、模板和数据(Phase III)。