论文

进化任务发现:通过技能构成和复杂性扩展推进推理前沿

Evolutionary Task Discovery: Advancing Reasoning Frontiers via Skill Composition and Complexity Scaling

模型训练合成数据

摘要

大语言模型(LLM)的推理前沿通过现代 后训练 范式(例如,可验证奖励的强化学习(RLVR))取得了显着进步。然而,这些方法的有效性仍然从根本上受到训练数据的多样性和复杂性的限制。一种实用的解决方案是数据合成;然而,依赖于非结构化突变或探索的流行方法会遭受同质性崩溃,无法系统地扩展推理边界。为了克服这个问题,我们提出了进化任务发现(EvoTD),这是一个将数据合成视为对算法技能和复杂性属性的双轴流形的定向搜索的框架。我们引入结构化进化算子来驾驭这个空间:交叉算子可以合成新颖的技能组合以增强多样性,参数变异算子可以缩放结构约束(例如输入大小、树深度)以驱动稳健的泛化。至关重要的是,我们集成了动态的最近发展区域过滤器,确保任务位于模型的可学习区域内。根据经验,EvoTD 提供了巨大的推理增益,可以在模型架构、预训练机制和规模上一致地推广,这表明结构化进化课程可以有效支持推理改进。我们在 https://github.com/liqinye/EvoTD 上发布了我们的代码。