论文

SRBench 与 PromptSR:系统综述筛选自动化的评测框架

A Benchmark Framework for Screening Automation in Systematic Reviews

模型评测基准与评测资源

摘要

系统综述是循证研究的重要基础,但文献筛选非常耗时、费力。LLM 可以辅助判断文章相关性,从而减少负担。然而现有评测经常使用传统指标,在高度类别不平衡的系统综述筛选数据上可能产生误导。本文提供一个包含 45,064 条标注记录的基准数据集,来自 32 项经过整理的二次研究,用于评估 LLM 的综述筛选表现;同时提出考虑类别不平衡的评测框架,即考虑综述中排除文章天然多于纳入文章这一情况。研究还推出 PromptSR,支持基于 LLM 的筛选提示实验、实验管理与结果分析,并提供展示 SRBench 和 PromptSR 用法的案例。