论文

SciLitBench:LLM辅助系统文献综述的基准与设计原则

SciLitBench: Benchmark and Design Principles for LLM-Powered Systematic Literature Reviews

模型评测基准与评测资源

摘要

系统审查需要对数千条记录进行持续的人工判断,但现有的大型语言模型 (LLM) 评估通常会孤立地检查审查阶段。我们推出了 SciLitBench,这是一个涵盖标题和摘要筛选、全文筛选和模式引导数据提取的多阶段基准,包含 42,981 条检索记录、1,012 条全文以及 888 篇收录论文的注释。在来自六个模型系列的 22 个开放权重大语言模型中,明确的纳入和排除标准将标题和摘要筛选 $F_2$ 提高了 28.8%,而研究人员撰写的理由将全文筛选提高了 15%。数据提取揭示了不同的可靠性体系:性能从出版年份的 0.97 准确度下降到计算方法的 0.37 Jaccard 重叠,而最强的模型仅恢复 30% 的注释评估证据和 25% 的限制。 SciLitBench 确定了高召回率筛选和证据完整提取之间的实际界限,并为评估 LLM 辅助证据合成提供了可重复的资源。

SciLitBench:LLM辅助系统文献综述的基准与设计原则:论文配图
图 1:跨标题/摘要筛选、全文筛选和数据提取的 SciLitBench 构建。第一阶段:标题和摘要 (TA) 筛选。在 42,981 条检索到的记录中,有 2,000 条经过手动注释,并分为开发子集、小样本子集和评估子集。使用模型和集成实验来确定最高精度的配置,在评估分割上实现完美的召回。此配置应用于其余 40,981 条记录,产生 4,165 个用于手动重新注释的预测阳性,以及 36,816 个预测阴性保留为银排除项。对预测阳性的手动审查确定了 1,767 个额外包含项和 2,398 个排除项;加上最初带注释的集合中的 52 个包含内容,产生了 1,819 个标题/摘要包含内容。另外,还对 500 个银排除的随机样本进行了重新注释,以估计假阴性污染。第 2 阶段:全文 (FT) 筛选。检索了第一阶段结转的 1,012 条记录的全文。使用手动注释的 200 篇论文集进行全文模型评估和模型选择。然后,将实现完美召回的最高精度配置应用于其余 812 篇论文,产生 785 个用于手动重新注释的预测阳性结果和 27 个银排除结果。人工审查确定了 728 个额外纳入项和 57 个排除项。结合初始注释集中的 172 个包含内容并删除 12 个重复项后,生成了 888 篇用于数据提取的论文。第 3 阶段:数据提取 (DE)。模式开发始于研究人员定义的提取目标和用于构建六个初始模式的 50 篇论文样本。 Llama 3.3-70B 在整个语料库中生成原始提取报告,协作者从中传递建议的类别合并、拆分、边缘情况和异常。研究人员审查了这些建议,解决了冲突,并最终确定了六种提取模式:出版年份、领域、审查阶段、方法、评估结果和局限性。研究人员随后将最终确定的模式应用于所有 888 篇论文,产生了 16,777 个人工注释。使用相同的模式从 22 个大语言模型获取机器注释。封闭字段以编程方式进行评估,而开放式评估结果和限制字段则使用基于 100 篇论文校准集和 29,724 个标记法官决策的校准大语言模型作为法官协议进行评估。实线箭头表示通过审核管道的主要数据流;虚线框表示评估或审计部分,而不是额外的审查阶段。