论文

软件工程系统评审中 LLM 筛选表现是否已停滞?

Has LLM Screening Performance Stalled in Software Engineering Systematic Reviews?

模型评测评测方法与指标模型能力评测

摘要

系统评价 (SR) 中的筛选是手动且耗时的。先前的工作已经探索了大型语言模型(LLM)来自动化此步骤,但 LLM 正在迅速发展,因此早期的性能声明可能不再准确地反映其筛选性能。我们使用现有的软件工程 SR 筛选基准 (SESR-Eval) 作为我们的数据。我们还对一个新的、更小的数据集 (SESR-Eval-Mini) 进行了功率采样,可以以更低的成本进行评估。使用这些数据,我们评估了八个新的LLM的筛选表现。此外,我们测试了不同的提示,分析了LLM在筛选决策和标准方面的一致性,并检查了细化纳入和排除标准对筛选表现的影响。八个新的LLM的表现略好于七个旧的LLM:平均。中学研究的 MCC 从 0.347 上升至 0.365。中学学习之间的差异仍然比LLM之间的差异更大。根据标准级决策计算总体筛选决策只会略微降低筛选性能。 LLM 们通常在以下方面达成一致: 尽管某些纳入和排除标准比其他标准表现出更大的分歧,但他们相应的筛选决定(平均 Gwet 的 AC1 = 0.830)。细化纳入和排除标准略微提高了回忆率,并使一些LLM更容易做出决策,但标准细化的总体影响不大。LLM尚未准备好在论文筛选中取代人类,而且新的、成本更高的模型带来的优势似乎非常有限。基于代理的方法、快速工程和进一步的标准细化是未来三个潜在的研究途径。