论文

AutoDataBench:Agent可以编写满足自我改进循环的数据吗?

AutoDataBench: Can Agents Write the Data That Feeds the Self-Improvement Loop?

智能体系统Agent任务评测

摘要

最近语言模型能力的进步更多地来自数据而不是架构。前沿实验室和数据公司生产可验证的agentic任务,监督微调和强化学习,然后变成http://capability.This生产线,仍然依赖于人力和人在环协作。自动化任务创建将使数据生产通过计算而不是专家人数来扩展,将扩展到更多领域,并将实现递归自我改进(RSI)的关键一步。目前对智能体编写此类任务的能力的评估衡量的是模型在对智能体生成的内容进行训练后的表现。这与数据行业的常见做法不符,数据是逐个样本提供的,每个样本都根据一组标准接受,而不是直接投入训练。现有的评估没有询问单个任务是否满足数据管道的验收标准。因此我们引入了 AutoDataBench。给定原始基准任务和尝试该任务的目标模型的记录,Agent必须为同一套件编写一个新任务,以满足有效性、新颖性、难度和行为覆盖方面的实际接受标准。在可执行Agent任务的三个基准测试中,我们评估的Agent在 45 分钟的默认时间预算下得分均高于 20(满分 100)。给最强大的Agent四倍的时间可以大大提高其得分,而一项可用任务的成本几乎保持不变。当前的Agent可以编写所需质量的训练任务,但效率不高。 AutoDataBench 提供了对Agent自主数据合成能力的直接衡量:一次一个工件,根据生产管道应用的标准进行判断,并且无需训练运行。代码和数据可在 https://github.com/StarDewXXX/AutoDataBench. 获取