论文

AutoData:通过Agent搜索预训练数据选择算法

AutoData: Agentic Search for Pre-training Data Selection

模型训练预训练

摘要

LLM智能体通过执行反馈编辑模型与训练代码,在自动化机器学习工程上展现潜力,但数据仍大多位于这一优化闭环之外。我们将预训练数据选择表述为基于逐文档特征的启发式工程,特征包括词汇统计、类别标签和困惑度。我们提出直接搜索可执行选择算法的AutoData。不同于只优化固定领域集合权重的既有数据混合方法,AutoData搜索更丰富的评分、分层和随机选择规则程序空间,通过代理模型验证反馈迭代改进算法,自动发现特征交互。在一夜的搜索内,AutoData找到优于现有人类设计清洗流水线的选择算法。尽管仅在小代理模型上搜索,该配方仍可迁移到更大规模并改善下游CORE指标。结果说明数据工程可以作为智能体机器学习问题,将自主研究从模型和训练代码优化扩展到数据。

AutoData:通过Agent搜索预训练数据选择算法:论文配图
图6:ClimbMix的53分片样本池中的特征相关性。(a)基于LLM标注特征的主题分布;(b)基于表面特征的主题分布。