论文

CurateEvo:Agentic 后训练 的数据管理不断发展

CurateEvo: Data-Curation Evolving for Agentic Post-Training

模型训练合成数据

摘要

大语言模型 (LLM) 代理需要 后训练 方法来改进环境反馈的长期决策。然而,现有的代理 后训练 管道通常将数据管理视为固定的预处理步骤,主要关注数据增强,而忽略过滤、细化和对下游故障的适应。我们提出了 CurateEvo,一个用于代理 后训练 数据管理的故障驱动的动态演化框架。 CurateEvo 将管理策略表示为可执行代码,并使用保留的开发集中的失败轨迹迭代地重写它。在每个时期,进化策略都会将固定的原始语料库转换为受监督的 微调 数据、强化学习数据和推理时间记忆库。演进过程首先通过诊断重复出现的故障模式并相应地增加、过滤或细化数据来提高有效性,然后在成本意识目标下通过修剪冗余或低效用的训练轮次来提高效率。在标记数据和野生数据设置下对 ACEBench-Agent、BFCL-V4 和 τ^2-Bench 进行的实验表明,CurateEvo 始终优于先前的管理方法,平均得分分别提高了 3.2 分和 2.7 分。进一步的分析表明,CurateEvo 与不同的 后训练 配方兼容,并大大减少了管理开销。