论文

通用智能体能自动化数据策展吗?

Can Generalist Agents Automate Data Curation?

智能体系统Agent任务评测

摘要

整理训练数据是现代人工智能开发中最重要但也是劳动密集型的部分之一:从业者根据嘈杂的基准反馈迭代地提出、实施、评估和修改数据策略。我们询问通才编码代理是否可以自动化这个数据管理循环。我们推出 *Curation-Bench*,这是一个以代理为中心的基准测试,它修复了模型、训练配方和评估套件,同时让代理可以通过命令行访问检查数据、实施策略、将其提交到固定的训练/评估管道并进行修改。在视觉语言指令调整实例中,开箱即用的代理在十次迭代内达到了强大的已发布数据选择基线。然而,轨迹分析揭示了持续存在的“执行-研究差距”:即使给出了策略指南和论文参考资料,代理也主要调整本地政策变体,而不是探索新的政策系列。支架要求每次迭代都引用、实例化和调整先前的方法,从而使代理转向方法引导的探索。脚手架代理无需人工设计输入即可自主制定数据选择策略,该策略的数据预算仅为其数据预算的十分之一,优于已发布的强大基线。总体而言,当前的代理可以运行管理循环,但可靠的数据研究需要支架式方法适应,而不是单独的开放式提示。代码和基准是开源的。

通用智能体能自动化数据策展吗?:论文配图
图 1:代理数据管理需要的不仅仅是开放式提示。 (a) 我们将数据管理制定为策略搜索循环:代理提出数据策略,构建训练数据,观察固定训练和评估的反馈,并修改策略。 (b) 在从用于 LLaVA-1.5-7B 训练的 LLaVA-665K 数据集中选择 10k 个示例时,开放式提示优于随机选择和人工设计的基线 Wu 等人。 (2024);杨等人。 (2025),但是方法适应脚手架通过将先前的数据选择方法调整为更强大的策略来实现最佳结果。