论文

DataMaster:以数据为中心的自主人工智能研究

DataMaster: Data-Centric Autonomous AI Research

智能体系统Agent 架构与控制循环

摘要

随着模型系列、训练方法和计算预算变得越来越标准化,机器学习系统的进一步收益越来越依赖于数据。然而,数据工程仍然主要是手动和临时的:从业者反复搜索外部数据集,使它们适应现有的管道,通过下游训练验证候选数据,并从先前的尝试中吸取教训。我们研究任务条件自主数据工程,其中自主代理通过仅优化数据侧来改进固定学习算法,包括外部数据发现、数据选择和组合、清理和转换。目标是在保持学习算法不变的情况下获得更强的下游解决方案。为了解决自主数据工程中固有的开放式搜索空间、分支相关的细化和延迟验证问题,我们提出了 DataMaster,这是一个集成了树结构搜索、共享候选数据和累积内存的数据代理框架。 DataMaster 由三个关键组件组成:组织替代数据工程分支的 DataTree、存储发现的外部数据源以供重用的共享数据池以及记录节点结果、工件和可重用结果的全局内存。这些组件共同允许代理发现候选数据,构建可执行的训练输入,通过下游反馈对其进行评估,并跨分支携带有用的证据。我们使用两种类型的基准测试来评估 DataMaster:MLE-Bench Lite 和 PostTrainBench。在MLE-Bench Lite上,较初始成绩提升32.27%的奖牌率;在 PostTrainBench 上,它超越了 GPQA 上的指导模型(31.02% vs 30.35%)。