论文

SHELF:用于多任务书目基准测试的综合工具

SHELF: A Synthetic Harness for Multi-Task Bibliographic Benchmarking

模型评测基准与评测资源

摘要

图书馆和档案馆以有限的人员和计算预算管理大量馆藏,但通用基准并没有系统地测试他们的书目工作。他们需要知道哪些方法适合他们的任务以及这些方法需要什么运行。 SHELF(用于评估 LLM 健康状况的合成Harness)弥补了这一差距。它是一个 Python 系统,可将标记的分类法、编写规范和生成预算转化为受控的基准数据和评估任务。第一个版本包含 62,899 个基于美国国会图书馆词汇表的模型编写文档,具有分类、聚类、检索、对分类和指令检索任务。我们比较 TF、TF-IDF、BM25、流行的编码器,以及仅在主题分类上的零样本解码器;每种方法仅出现在支持它的任务上。主题分类达到 0.8887,而流派形式分类仅达到 0.2605,并且几个配对和聚类任务仍然接近机会。稀疏方法在分类方面仍然具有竞争力,而 TF-IDF 是主题计时实验中最快的测量臂。 SHELF 还独立地改变书目方面,并且可以在模型训练结束后生成新的、可验证的未见过的文档。与 LCSHBench 和 Project Gutenberg 的比较表明,模型排名比绝对分数传递更可靠,但 SHELF 分数不能估计生产目录数据的准确性。我们在 GitHub 和 Hugging Face 上根据许可发布所有源代码和数据。