论文
基于LoRA的微调的大语言模型自动化测试用例生成的实证研究
An empirical study of LoRA-based fine-tuning of large language models for automated test case generation
摘要
由于需求的模糊性以及生成结构化、可执行测试工件的需要,根据自然语言需求自动生成测试用例仍然是软件工程中的一个具有挑战性的问题。 LLM 的最新进展已显示出解决此任务的希望;然而,它们的有效性取决于特定任务的适应和有效的 微调 策略。在本文中,我们对使用参数高效的 微调(特别是 LoRA)进行基于需求的测试用例生成进行了全面的实证研究。我们在统一的实验流程下评估多个 LLM 系列,包括开源和专有模型。该研究系统地探讨了关键 LoRA 超参数(包括秩、缩放因子和 dropout)对下游性能的影响。我们提出了一个基于 GPT-4o 的自动评估框架,它可以跨九个质量维度评估生成的测试用例。实验结果表明,基于LoRA的微调显着提高了所有开源模型的性能,其中Ministral-8B取得了最好的结果。此外,我们还表明,经过微调的 8B 开源模型可以实现与预先微调的 GPT-4.1 模型相当的性能,凸显了参数高效自适应的有效性。虽然 GPT-4.1 模型实现了最高的整体性能,但在 微调 之后,专有模型和开源模型之间的性能差距大幅缩小。这些发现为自动测试生成的模型选择、微调 策略和评估方法提供了重要见解。特别是,他们证明,当与精心设计的 微调 方法相结合时,经济高效、可本地部署的开源模型可以作为专有系统的可行替代方案。