论文
CroissantMiner:自动抽取与验证数据集元数据
CroissantMiner: Automated Extraction and Validation of Croissant Metadata for ML Datasets
摘要
Croissant 已成为机器可读数据集元数据的标准,但填充其字段仍然是劳动密集型的,并且需要仔细阅读随附的数据集文档。我们提出了第一个基准测试,支持对与社区标准模式一致的元数据提取进行端到端评估。该基准包含 602 篇论文,其中 102 篇具有经过人类验证的人工金标,500 篇具有 LLM 生成的银标标注,涵盖了包含核心和负责任 AI (RAI) 领域的完整 Croissant 模式。使用此基准,我们在两层评估框架下评估了一系列涵盖前沿模型、开放权重 模型和 Agentic 架构的提取系统,该框架将基于规则的评分与通过人工审核选择的 LLM 法官相结合。我们发现单通道提取始终优于我们评估的四种 Agentic 架构:在 骨干模型 中,这些分解的变体实现的精度低于单个全上下文通道。最大的差距出现在长格式 RAI 字段上,这些字段需要综合和解释分散在纸张上的信息,而不是从单个位置复制信息,而当前系统在这种情况下仍然远不可靠。我们发布了基准测试、评估代码、评审审核、现场演示以及对新系统开放的排行榜。
