论文
利用大语言模型开展疾病传播模型的系统性文献综述
Leveraging Large Language Models for Systematic Literature Review of Disease Spread Models
摘要
大语言模型(LLM)的最新进展为精简乃至自动化许多研究流程创造了新机会,其中包括系统性文献综述(SLR)。本研究报告了一个LLM管线的开发,用于从536篇同行评审的基于主体建模(agent-based modeling)论文中抽取与模型相关的信息,并将结果与人工开展的系统性文献综述进行比较。结果显示,GPT-4.1的论文级准确率约为77.95%,GPT-5.0约为81.67%。字段级准确率介于32.40%到100.00%之间,更复杂或更主观的字段表现较不可靠。重要的是,我们发现LLM之间的一致性是输出质量的一个潜在指标:低一致性可能提示幻觉,而高一致性结合低准确率则可能指向人工数据集中的噪声或错误。总体而言,我们的研究为提示词开发提供了实践洞见,并揭示了在建模与仿真领域将LLM用于全面系统性文献综述的潜力与局限。
