论文

计算机科学系统评论集

A Collection of Systematic Reviews in Computer Science

模型评测基准与评测资源

摘要

系统评价是综合科学证据的标准方法,但其创建需要大量的手动工作,特别是在检索和筛选过程中。虽然最近的工作已经探索了这些步骤的自动化,但评估资源仍然主要局限于生物医学领域,限制了其他领域的可重复实验。本文介绍了 SR4CS,这是计算机科学领域的大规模系统评论集合,旨在支持布尔查询生成、检索和筛选的可重复研究。该语料库包含 1,212 条系统评论及其原始专家设计的布尔搜索查询、104,316 条已解决的参考文献以及结构化方法元数据。为了进行受控评估,原始布尔查询还以对标题和摘要进行操作的标准化、近似形式提供。为了说明该集合的预期用途,基线实验将近似的专家布尔查询与零样本 LLM 生成的布尔查询、BM25 和统一评估设置下的密集检索进行了比较。结果突出了检索范式之间在精确度、召回率和排名行为方面的系统差异,并暴露了朴素零样本布尔生成的局限性。 SR4CS 在 Zenodo (https://doi.org/10.5281/zenodo.17163932) 上的开放许可证下发布,并附有文档和代码 (https://github.com/webis-de/scolia26-sr4cs),以实现可重复的评估和扩展系统评审自动化的未来研究。