LLM 辅助系统评价筛选的辅助不确定性信号:八个 Cohen 药物类别评价的基准
Auxiliary uncertainty signals for LLM-assisted systematic review screening: a benchmark across eight Cohen drug-class reviews
摘要
大语言模型 (LLM) 越来越多地用于系统评价中的标题摘要筛选,但他们的决策缺乏校准的不确定性。我们证明了辅助 BERT+GCN 分类器提供了结构化的不确定性信号,可以提高 LLM 筛选效率,并且我们确定了最大化效益成本比的即时交付策略。我们使用 3 个种子 x 5 倍分层交叉验证(600 倍水平结果),在 Cohen (2006) 基准的 8 个药物类数据集上评估了 5 个 LLM 即时交付条件。按折叠训练的 BERT+GCN 模型通过两个谱测试(代数根式和分类悖论)将每张试卷分类为 INCLUDE、EXCLUDE 或 MAYBE。条件不同,信息内容(无/标签/满分)、选择性(所有论文与仅可能)和时间安排(主动与被动两遍)。在三个数据集上针对 gpt-4.1-mini 的跨模型试点测试了跨代传输。三项发现:(i) 全上下文交付以 1.28 倍的词元成本溢价在 F1(+0.011,配对 Wilcoxon p=0.008)和 WSS@95(+0.050,p=0.039)中带来显着收益,同时保留召回率。 (ii) 仅 MAYBE 路由是帕累托最优:最高平均召回率 (0.92) 和 AUC-ROC (0.54),而基线成本仅为 1.05 倍——全上下文开销的六分之一。 (iii) 两遍设计升级了 22.2% +/- 8.8% 的记录,但从未修改其决定(所有数据集和折叠的翻转率为 0%),提供了决定性的证据,表明当前指令调整的 LLM 无法进行自我分类。跨模型试点显示,两代 LLM 的召回率均提高了 0.8%。每篇论文对 20,796 个观察值的消融表明,双重悖论检验在经验上可简化为一行 logits 间隙标准。我们发布了完整的管道;运行 600 次的实验将在一小时内从缓存的 LLM 响应中重播。