论文

AutoDataBench:加速汽车研究的以数据为中心的测试平台

AutoDataBench: A Data-centric Testbed for Accelerating Auto Research

智能体系统Agent任务评测

摘要

现有的自动研究基准通常会涉及多个改进来源,包括训练框架、超参数、计算预算和数据,因此很难将一个前沿智能体优于另一个智能体的原因归因于特定的研究能力。在这项工作中,我们分离并系统地评估数据智能:Agent理解、操作和改进塑造模型能力的数据的能力。我们推出了 AutoDataBench,这是一个建立在涵盖数据诊断、数据组织和数据构建的数据智能概念框架之上的受控测试平台,通过三个精心策划的优化任务进行实例化,同时固定非数据因素。在工具使用、检索和知识注入方面,我们评估了前沿大语言模型在特定任务资源预算下通过迭代实验改进训练数据的能力。除了优化性能之外,我们还问:大语言模型是否了解他们的数据干预措施的作用?我们将训练前做出的预测与观察到的结果进行比较,以寻求超越试验和错误的数据效应推理的证据,并探讨迭代反馈是否有助于大语言模型更好地理解训练数据的变化如何影响模型性能。最后,我们表明,在训练中期重用 AutoDataBench 轨迹可以提高下游编码性能,突出其在评估数据智能和生成高质量训练数据方面的价值。代码和资源可在 https://github.com/AutoDataBench/AutoDataBench. 获取