论文

Agentic Proposing:通过组合式技能合成增强大语言模型推理

Agentic Proposing: Enhancing Large Language Model Reasoning via Compositional Skill Synthesis

模型训练强化学习合成数据Agentic RL

摘要

推进大语言模型的复杂推理依赖高质量、可验证的数据集,但人工标注成本高昂且难以规模化。当前的合成范式常面临反复出现的权衡:保持结构有效性往往限制问题复杂度,而放松约束以提升难度又常导致不一致或无解的实例。为此,我们提出Agentic Proposing,一个将问题合成建模为目标驱动的序贯决策过程的框架,其中专门的智能体动态选择并组合模块化推理技能。通过内部反思与工具使用的迭代工作流,我们使用多粒度策略优化(Multi-Granularity Policy Optimization,MGPO)训练出Agentic-Proposer-4B,以生成覆盖数学、编码与科学领域的高精度、可验证训练轨迹。实证结果表明,在智能体合成数据上训练的下游求解器显著超越领先基线,并表现出稳健的跨域泛化。值得注意的是,仅用11,000条合成轨迹训练的30B求解器在AIME25上取得91.6%的最先进准确率,比肩GPT-5等前沿规模专有模型,证明少量高质量合成信号可有效替代大规模人工精选数据集。

Agentic Proposing:通过组合式技能合成增强大语言模型推理
图3:Agentic-Proposer 合成流水线。该框架按三个先后阶段演化:(阶段 1)技能获取(Skill Acquisition):从多样化语料中提取并过滤原子技能,构建自主技能库。(阶段 2)Agentic SFT:模仿包含内部反思、工具执行和动态技能剪枝的专家轨迹。(阶段 3)Agentic RL(MGPO):通过多粒度奖励优化策略。智能体遵循结构化推理流程(Draft → Check → Refine → Finalize),在基于课程(curriculum)的技能分布引导下,为下游求解器训练合成高难度且逻辑严密的问题。