论文

在一项概念复杂的范围综述中评估人类与LLM筛选工作流:召回—工作量权衡与运行间一致性

Evaluating human and LLM screening workflows in a conceptually complex scoping review: Recall--workload trade-offs and run-to-run consistency

模型评测鲁棒性、公平性与可信度评测

摘要

背景。大语言模型(LLM)越来越多地被用于证据综合中的筛选,而假阴性可能在全文评估之前就剔除相关研究。我们在一项预注册研究中比较了人类与LLM的标题-摘要筛选工作流,该研究嵌入于一项概念复杂的范围综述。方法。在保守的仅标题筛选之后,1,131条记录由一名综述负责人、四名筛选互不重叠子集的训练有素的助理、以及七次使用不同模型和处理配置的完整LLM运行进行筛选,其中包括一次名义上相同的重复运行。我们比较了保留工作量、对照316条经核实合格记录的操作性召回、一致性、运行间一致性和程序负担。由于只有进入母综述并被评估的记录才核实了合格性,召回估计属于操作性口径。结果。没有任何工作流找回了全部经核实的合格记录。人类工作流和两次GPT-5.4文件批次运行保留了42.2-45.0%的记录,同时达到82.3-82.9%的召回率。Gemini 3.1文件批次取得最高召回率(83.9%),但保留了56.7%的记录。一次性处理配置比相应的文件批次配置找回了更少的合格记录。两次名义相同的GPT-5.4文件批次运行在91.7%的记录上一致,但在94条记录上存在分歧,其中包括29条仅被其中一次运行保留的经核实合格记录。讨论。LLM筛选表现取决于所实施的工作流,而不仅是模型本身。因此,处理配置、工作量、记录层面的差异以及人机决策整合是已部署系统的实质性属性。对于高召回任务,LLM更适合经过验证、可审计、有人监督的工作流,而非自主排除。