论文
DataPrep-Bench:将 LLM 作为训练数据准备器进行基准测试
DataPrep-Bench: Benchmarking LLMs as Training Data Preparators
摘要
训练数据的质量从根本上决定了 大语言模型 (LLM) 的能力,但不存在统一的基准来衡量 LLM、代理和以数据为中心的工作流程实际端到端准备训练数据的情况。我们认为 LLM 驱动的数据准备包含两种互补的功能:数据构建(将原始来源转换为监督训练数据)和数据质量评估(在下游训练之前预测候选数据集的训练价值);自始至终,“质量”指的是下游训练效用,而不是表面的文本属性。我们推出了 DataPrep-Bench,这是第一个统一基准,可在六个域和多个基础模型的共享下游基础协议下联合评估这两种功能。对于数据构建,方法使用相同的原始源,并通过 微调 与 Dolly-15k 联合对其输出进行基本模型评分;除了这个赛道之外,我们还发布了 Data-Construction-Skill,这是一种技能引导的智能体,它在 Llama-3.1-8B Finance 上将 Dolly-only 基线绝对提高了近 20 个点,并且与知识提取密集领域中最强大的基于智能体和数据流的方法具有竞争力。对于数据质量评估,评分函数通过皮尔逊相关性与共享候选池上的下游性能进行评分;我们发布了分布对齐分数 (DAS),这是一种基于分布的评估器,在候选数据集和域代理之间使用 MMD。 DAS 在六个领域中的四个领域实现了最强的跨模型相关性,并且是唯一在数学、科学和医学领域同时清除 r > 0.70 的指标,优于现有的基于质量、多样性和启发式的评估器。 DataPrep-Bench 提供了一个统一的、基于下游的框架,用于衡量两种能力的进展,作为 LLM 驱动的数据准备的同等目标。