论文
Agentic Proposing:通过组合式技能合成增强大语言模型推理
Agentic Proposing: Enhancing Large Language Model Reasoning via Compositional Skill Synthesis
摘要
推进大语言模型的复杂推理依赖高质量、可验证的数据集,但人工标注成本高昂且难以规模化。当前的合成范式常面临反复出现的权衡:保持结构有效性往往限制问题复杂度,而放松约束以提升难度又常导致不一致或无解的实例。为此,我们提出Agentic Proposing,一个将问题合成建模为目标驱动的序贯决策过程的框架,其中专门的智能体动态选择并组合模块化推理技能。通过内部反思与工具使用的迭代工作流,我们使用多粒度策略优化(Multi-Granularity Policy Optimization,MGPO)训练出Agentic-Proposer-4B,以生成覆盖数学、编码与科学领域的高精度、可验证训练轨迹。实证结果表明,在智能体合成数据上训练的下游求解器显著超越领先基线,并表现出稳健的跨域泛化。值得注意的是,仅用11,000条合成轨迹训练的30B求解器在AIME25上取得91.6%的最先进准确率,比肩GPT-5等前沿规模专有模型,证明少量高质量合成信号可有效替代大规模人工精选数据集。
