论文
超越准确性:软件工程 SLR 证据筛选中的 LLM 变异性
Beyond Accuracy: LLM Variability in Evidence Screening for Software Engineering SLRs
摘要
背景:系统文献综述中的研究筛选成本高昂、容易出现不一致且风险不对称,因为假阴性可能会损害有效性。尽管 大语言模型 (LLM) 被迅速采用,但关于此类模型在研究筛选阶段如何表现的证据有限,特别是在特定 LLM 的选择及其与经典模型的比较方面。目标:评估 LLM 在筛选中的性能和变异性,量化输入元数据(摘要、标题、关键词)的影响,并将 LLM 与共享协议下的经典分类器进行比较。方法:我们在 2 个真实的系统文献综述 (SLR) 上分析了来自 4 个提供商(OpenAI、Google Gemini、Anthropic、Llama)的 12 个 LLM 和 4 个经典模型(逻辑回归、支持向量分类、随机森林和朴素贝叶斯),总计 518 篇论文。实验设计研究了 3 个关键维度:(i) LLM 性能变异性,(ii) 输入特征组成(摘要、标题和关键字)对 LLM 性能的影响,以及 (iii) 使用 LLM 而不是更传统的分类模型的实际收益。结果:即使在零温度下,LLM 也表现出显着的异质性和残余的不确定性。摘要可用性是决定性的:删除它会导致性能持续下降,而向摘要添加标题和/或关键字却没有带来显着的收益。与经典模型相比,性能差异不足以支持可推广的 LLM 优越性。讨论:LLM 的采用应该通过操作和治理约束(可重复性、成本、元数据可用性)来证明,并得到试点验证和可变性和输入配置的明确报告的支持。