论文

用于多语言等效突变体检测的 大语言模型:一项扩展的实证研究

Large Language Models for Multi-Lingual Equivalent Mutant Detection: An Extended Empirical Study

摘要

突变测试是确保软件质量的强大技术。然而,等效突变体的存在引入了不必要的成本和偏差,限制了其实际有效性。尽管已经提出了许多等效的突变体检测(EMD)方法,但它们通常面临着不同的挑战:纯代码分析方法可能由于对特定编译器基础设施的依赖而受到限制,而现有的机器学习方法仍然受到训练数据稀缺和对看不见的突变体的有限泛化的限制。 大语言模型 (LLM) 最近通过更好地捕获程序语义,在各种与代码相关的任务中展示了卓越的性能。然而,它们的 EMD 潜力在很大程度上尚未被开发,特别是在多语言环境中。本文提出了针对 EMD 的 LLM 的首次全面实证研究,使用 3,302 个 Java 和 1,088 个 C 突变体对来对最先进的方法进行基准测试、探索策略变化、评估效率并评估跨语言泛化。实验结果表明,基于 LLM 的方法比评估的传统方法获得了更高的 F1 分数,并且微调的代码嵌入在测试的策略中产生了最高的检测精度。此外,基于 LLM 的方法在有效性和效率之间取得了实际平衡,推理时间与现有机器学习模型相当。重要的是,经过微调的 LLM 展示了跨编程语言的可测量的泛化性。这些发现使 LLM 成为解决等效突变体检测长期挑战的可行且有效的方法,为在实践中推进突变检测提供了新的方向。