论文

Autodata:创造高质量合成数据的智能体数据科学家

Autodata: An agentic data scientist to create high quality synthetic data

模型训练合成数据

摘要

我们介绍Autodata——使AI智能体充当数据科学家、构建高质量训练与评估数据的通用方法。我们展示如何训练(元优化)这样的数据科学家智能体——使其学会创造更强的数据。我们描述总体形式化——以及一个具体实践实现——智能体自指令(Agentic Self-Instruct)。我们在计算机科学研究任务、法律推理任务与数学对象推理上开展实验——相较经典合成数据集创建方法取得改进结果。此外——对数据科学家智能体本身的元优化带来更大性能提升。智能体数据创建提供了把增加的推理算力转化为更高质量模型训练的途径。总体而言——我们相信该方向有潜力改变我们构建AI数据的方式。

Autodata:创造高质量合成数据的智能体数据科学家:论文配图
图 1:自动数据管道。该框架采用一个自主代理来模拟数据科学家的角色,迭代生成数据,进行定性检查和定量性能评估,综合见解并更新数据生成配方。可以使用内循环中使用的相同标准来训练代理本身,使其更好地担任数据科学家的角色。这个循环过程旨在逐步提高数据质量;该图描述了可能实例化的一般工作流程。