论文
DataFoundry:通过递归自我改进改进数据准备器
DataFoundry: Evolving Data Preparators via Recursive Self-Improvement
摘要
大语言模型 的领域适应越来越依赖于构建高质量的训练数据,但现有的数据准备管道通常仅在生成后通过事后过滤来解决质量问题。这造成了根本性的不匹配:数据质量问题通常源于施工过程本身,而质量控制仅应用于其输出。我们引入了 \textsc{DataFoundry},这是一个在大规模数据生产之前用于 \textbf{通过递归自我改进来进化数据准备器}的框架。 \textsc{DataFoundry} 将数据准备器表示为可演化的运行时规范,并通过 \textsc{Skills-as-Modules} 架构实例化其演化,其中中央 \textsc{Controller} 编排模块化技能来编译可执行运行时,使用适合领域的标准诊断小型试点集的缺陷,并将诊断反馈转换为适配器,以修改各个准备组件,同时保留稳定的接口。我们在 DataPrep-Bench 上跨数学、金融、法律和医学评估 \textsc{DataFoundry},发现递归进化的准备器生成的训练数据具有比基线更高的下游效用。跨不同骨干网的实验进一步证明,这些改进与特定模型无关,而分析和案例研究进一步揭示了框架的优化动态,并说明了其演变在实践中是如何展开的。