论文
了解标题摘要筛选中的 LLM:从分歧到建议
Understanding LLMs in Title-Abstract Screening: From Disagreements to Recommendations
摘要
几项研究检验了 大语言模型 (LLM) 在系统评价 (SR) 中进行标题摘要筛选的用途,报告的准确性不一。然而,可靠性问题在很大程度上仍未得到解决。在这项研究中,我们超越了定量的 LLM 人类一致性指标,而是定性地研究了 LLM 失败的方式和原因。我们还提出了可行的建议。我们分析了 LLM 和研究人员在 6 个软件工程 SR 和 1,000 多篇主要研究论文中的分歧。对于每个 SR,论文均由人类专家和 LLM 在零样本模式下独立筛选,得出的 Kappa 值范围为 0.52 至 0.77。定性分析表明,人类-LLM 分歧是由反复出现的、可识别的原因造成的,例如关键术语的边界模糊、关键字过分强调以及不正确的主题推断。基于这些发现,我们提出了一些建议,例如在部署之前验证语义理解、运行多个 LLM 以及将验证工作重点放在边界案例上。需要未来的研究来验证我们建议的影响,并且需要社区努力制定有关 SR 中 LLM 使用的规范指南。