论文

探索模型专业化的自主代理数据工程

Exploring Autonomous Agentic Data Engineering for Model Specialization

模型训练合成数据

摘要

大语言模型 (LLM) 在一般任务上表现出了强大的性能,但在没有高质量的特定领域数据的情况下常常难以适应专门领域。现有的基于LLM的数据管理方法主要依赖于人为设计的工作流程,而没有检验LLM是否可以自主执行端到端的数据工程管道以实现模型专业化。我们将自主代理数据工程正式化,这是一项新颖的任务,旨在评估 LLM 作为自主数据工程师,通过端到端数据管理推动模型专业化。我们将数据构建为可优化的组件,并研究在 后训练 性能改进的指导下跨多个领域规划、生成和迭代优化训练数据的代理。实验表明,自主的 LLM 数据工程师获得了巨大的收益,因为 GPT-5.2 构建了一个训练课程,完全通过迭代、代理驱动的数据适应,将学生模型改进了 57.29%。通过阐明潜力和瓶颈,我们的研究将自主数据工程确立为一种可衡量的能力,并绘制了一条通往代理驱动模型专业化的道路(代码将在 https://github.com/zjunlp/DataAgent 发布)。