论文

CroissantMiner:自动抽取与验证数据集元数据

CroissantMiner: Automated Extraction and Validation of Croissant Metadata for ML Datasets

模型评测基准与评测资源

摘要

Croissant 已成为机器可读数据集元数据的标准,但填充其字段仍然是劳动密集型的,并且需要仔细阅读随附的数据集文档。我们提出了第一个基准测试,支持对与社区标准模式一致的元数据提取进行端到端评估。该基准包含 602 篇论文,其中 102 篇具有经过人类验证的人工金标,500 篇具有 LLM 生成的银标标注,涵盖了包含核心和负责任 AI (RAI) 领域的完整 Croissant 模式。使用此基准,我们在两层评估框架下评估了一系列涵盖前沿模型、开放权重 模型和 Agentic 架构的提取系统,该框架将基于规则的评分与通过人工审核选择的 LLM 法官相结合。我们发现单通道提取始终优于我们评估的四种 Agentic 架构:在 骨干模型 中,这些分解的变体实现的精度低于单个全上下文通道。最大的差距出现在长格式 RAI 字段上,这些字段需要综合和解释分散在纸张上的信息,而不是从单个位置复制信息,而当前系统在这种情况下仍然远不可靠。我们发布了基准测试、评估代码、评审审核、现场演示以及对新系统开放的排行榜。

CroissantMiner:自动抽取与验证数据集元数据:论文原图
图 1:CroissantMiner 数据创建管道。 (1) 语料库:来自下载量最高的 Hugging Face 数据集(视觉、NLP、音频等)的 ML 数据集论文。 (2) 提取:单通道 LLM 生成每张纸 30 字段羊角面包元数据,形成银分割和金分割的预填充。 (3) 注释:注释者根据带有故障模式标签(例如幻觉、不完整)的 3 级评分标准(正确/部分正确/不正确)对每个预填内容与源论文进行评分,在 3,060 个单元格上产生 9,595 个评分。 (4)裁决:多数票决定95%的单元格;资深作者的审查解决了剩下的问题。