论文

LLM 在 SE 域中生成分类法的效果如何?多视角评估框架

How Well Do LLMs Generate Taxonomies in the SE Domain? A Multi-perspective Evaluation Framework

模型评测模型能力评测

摘要

分类法提供了一个共享的概念框架,用于组织软件工程 (SE) 研究中的异构观察。手动构建此类分类法是劳动密集型的,并且需要具有 SE 领域专业知识的注释者。虽然 大语言模型 (LLM) 的进步导致 SE 领域之外自动分类生成方法的出现,但它们对技术复杂的 SE 工件的适用性仍不清楚。在这篇经验论文中,我们通过多视角评估框架,首次对最先进的自动化方法在 SE 工件上的表现进行了全面的实证评估,包括分类质量、与人类专家定义的分类的一致性、独立注释下的可靠性和效率。为了支持这一评估,我们系统地收集了七篇具有公开可用的工件和人类定义的分类法的 SE 论文,并使用两种自动化方法(TnT-LLM 和 CLIMB)和 5 个最先进的 LLM 进行实验。我们的评估揭示了一个明显的权衡:TnT-LLM 构建了与人类定义的分类法相当的高质量分类法,但会产生更高的成本和运行时间,并且往往会生成过于复杂的分类法,而 CLIMB 速度快 15--40$\times$,便宜 8--49$\times$,但当需要超出表面级别相似性​​的技术推理时,质量得分往往较低。这些发现表明,TnT-LLM 和 CLIMB 可用于 SE 领域的实际情况,而研究人员应首先使用目标数据的子集评估生成的分类法的复杂性及其成本,以决定是否使用自动化方法或人类专家。我们的工作代表了系统地理解 SE 中自动分类生成的第一步,为未来的研究和实践提供了可行的见解。