论文

LUMEN:用于自动系统审查和荟萃分析的成本透明的多代理管道

LUMEN: Cost-Transparent Multi-Agent Pipeline for Automated Systematic Review and Meta-Analysis

应用与实践科学研究

摘要

系统评价和荟萃分析 (SR/MA) 仍然是证据合成的金标准,但完成一项通常需要 67 周的时间和大量的专家努力。最近的 大语言模型 (LLM) 系统在各个 SR 阶段表现出了强大的性能 - 筛选(otto-SR:96.7% 灵敏度)、提取(Gartlehner 等人:91.0% 准确率)和搜索(TrialMind:0.83 召回率) - 但没有研究报告运行端到端管道的实际成本、成本如何在阶段之间分配或架构选择如何影响成本与质量的权衡。我们推出了 LUMEN,这是一个开源多代理管道,它使用 11 个专门的 LLM 代理和经过深思熟虑的模型路由来自动化六个 SR/MA 阶段。我们在七个数据集上评估 LUMEN:五个自行进行的领域评审(精神病学、心理学、外科、疫苗学、心脏病学)和两个 SYNERGY 筛选基准。在 13 个 真值 可比较的结果中,LUMEN 与已发表的荟萃分析达到 100% 的方向一致性,同质研究设计的效应大小在 1% 以内。主要贡献是此类管道的第一个经验成本和运营特征:完整的审查成本为 19 至 29 美元(中位数 22.65 美元),其中标题摘要筛选和数据提取共同占据主导支出。三臂提取消融揭示了相位相关的架构逆转:多代理设计会损害筛选,但对于提取至关重要,可产生比单模型替代方案多 5.7 倍的可合并分析,同时消除临床上危险的方向错误。两个数据集筛选基准表明模型排名是依赖于领域的,并且不能跨评论主题转移。所有代码和成本日志都是公开的。