论文
使用 大语言模型 进行基于模型的自动化测试生成的实证评估
An Empirical Evaluation of Using Large Language Models for Automated Model-Based Test Generation
摘要
大语言模型 在软件工程任务,特别是软件测试方面表现出了强大的潜力。基于模型的测试(MBT)是一种软件测试技术。为了解决工业采用 MBT 所面临的广泛可扩展性挑战,我们的论文对基于模型的自动测试生成的 大语言模型 (LLM) 进行了实证评估,并与最先进的基于模型的测试工具 (GraphWalker) 及其内置算法(边缘和顶点覆盖设置的随机和快速随机)进行了比较。我们的评估表明,使用最近的五个最先进的 LLM(GPT-5.1、GPT-5.2、Claude Opus 4.5、Claude Sonnet 4.5 和 Gemini 2.5 Pro)针对四个 GraphWalker 模型(两个 Web 应用程序(Parabank 和 Testinium)和两个硬件应用程序(TLC 和 RISC-V))优化和缩短测试路径和步长的巨大潜力复杂性不断升级。