论文

语言模型能通过软件测试认证考试吗?案例研究

Can Language Models Pass Software Testing Certification Exams? a case study

模型评测模型能力评测

摘要

大语言模型 (LLM) 在学术研究和更广泛的社会应用中发挥着关键作用。 LLM越来越多地用于软件测试活动,例如测试用例生成、选择和修复。然而,仍然存在几个重要的问题:(1)LLM 是否拥有足够的有关软件测试原理的信息来有效地执行软件测试任务? (2) LLM对软件测试有足够的概念理解来回答变质变换下的软件测试问题吗? (3) 软件测试问题的某些属性是否会影响 LLM 的性能?为了回答这些问题,本研究评估了来自商业供应商和开源社区的 60 种多模式语言模型。该评估使用国际软件测试资格委员会(ISTQB)提供的30个不同类型(核心基础、核心高级、专家和专家)样本考试进行,用于评估人类测试人员的能力。每个模型总共根据 1,171 个问题进行评估。此外,为了确保充分的概念理解,模型还针对使用上下文保留变形技术转换的考试问题进行了测试。有两个模型在所有 30 项认证考试中得分至少 65%,通过了所有认证,其中商业模型的表现普遍优于开源模型。我们分析错误答案背后的原因,并提供改进软件测试认证考试设计的建议。