论文

深度神经网络的测试用例选择:LLM 代码的复制研究

Test Case Selection for Deep Neural Networks: A Replication Study on LLMs for Code

模型评测模型能力评测

摘要

最近,人们探索了测试用例选择(TCS)技术,以支持在有限的测试预算下对深度神经网络(DNN)进行操作评估,其中标签成本是主要关注点,早期发现模型故障是关键目标。尽管先前的研究报告了有希望的结果,但现有的实证评估几乎完全集中于基于视觉的 DNN 和数据集,因此尚不清楚先前的研究结果是否可以推广到 LLM 代码模型。本文提出了在 LLM 代码模型背景下 TCS 技术的大规模复制研究。我们重新审查了最初为 DNN 提出的既定 TCS 策略,并用之前未针对 TCS 评估的统计采样策略对其进行补充。我们评估了它们在三个与代码相关的分类任务上的有效性:克隆检测、漏洞检测和技术债务预测。该研究涵盖 17 个特定于任务的微调模型实例、7 个预测特征和 13 个选择策略,其中包括 12 个特征感知策略和作为与特征无关的基线的简单随机抽样 (SRS)。我们从两个维度评估性能:准确性估计和早期故障发现。结果表明,当 TCS 应用于 LLM 代码时,仅针对基于视觉的 DNN 报告的研究结果的子集进行了概括。特别是,基于不确定性的特征对于早期故障发现是有效的,而基于表示的特征对于精度估计来说更稳健。同时,不同任务和模型的性能差异很大,这表明 TCS 的有效性取决于上下文。总体而言,这项研究提供了关于 TCS 技术在基于视觉的深度学习之外的可复制性的经验证据,并提供了关于它们在 LLM 代码操作评估中的使用的见解。