论文
重温 Vul-RAG:使用开放权重模型进行基于 RAG 的漏洞检测的再现性和可复制性
Revisiting Vul-RAG: Reproducibility and Replicability of RAG-based Vulnerability Detection with Open-Weight Models
摘要
大语言模型 (LLM) 在自动化软件漏洞检测方面显示出强大的潜力,特别是在检索增强生成 (RAG) 设置中。然而,对于依赖专有模型和 API 的方法,可重复性和可复制性在很大程度上仍未得到探索,这就提出了所报告的结果是概括性的还是主要取决于特定模型选择的问题。在这项工作中,我们提出了 Vul-RAG 的可重复性研究,Vul-RAG 是一种基于 RAG 的源代码漏洞检测框架,通过高级漏洞知识增强了 LLM。我们首先使用报告的开放权重基线模型在完全本地和开放权重设置中复制结果。然后,我们将评估扩展到最近的各种开放权重 LLM,包括不同参数大小的代码专用模型、通用模型和推理模型。结果证实,Vul-RAG 的结果在本地部署下是可重复的,但偏差较小。在所有评估的模型中,我们观察到性能稳定在大约 0.30 成对精度(易受攻击的函数和修补函数都被正确分类的代码对)。值得注意的是,即使对于较新和先进的模型,这种稳定状态仍然存在,这表明仅模型容量的改进并不能显着提高性能。最后,我们讨论了检测有效性、模型功能和模型规模之间的实际影响和权衡。实施和评估工件可在 https://github.com/hs-esslingen-it-security/revisiting-Vul-RAG 上公开获取。