论文

检索、重现、揭示:剖析检索增强软件漏洞检测

Retrieve, Reproduce, Reveal: Dissecting Retrieval-Augmented Software Vulnerability Detection

模型评测评测方法与指标

摘要

检索增强生成 (RAG) 越来越多地用于通过基于检索到的漏洞知识(例如漏洞报告)中的预测来增强基于大语言模型 (LLM) 的软件漏洞检测。然而,现有的基于 RAG 的软件漏洞检测 (RAG4SVD) 系统通常使用专有模型进行评估,这对开放科学和可重复性提出了挑战。此外,研究使用不同的数据集、自定义知识库、不同的骨干模型和不同的指标,这阻碍了有意义的跨系统比较。在这项工作中,我们研究了六个开源 RAG4SVD 系统,并通过 (i) 在开放权重设置下再现其实验设置,以及 (ii) 使用通用数据集、度量套件和开放权重模型池的统一基准来解决这些可重复性和可比性挑战。此外,RAG4SVD 系统通常由多个组件组成,但通常仅作为整个系统(即端到端)进行评估。因此,我们执行 (iii) 组件级分析,将代表性 RAG4SVD 管道分解为输入抽象、知识检索和检测。我们的结果表明,不同系统的再现性差异很大。在所提出的统一基准下,已发布的 RAG4SVD 性能不会在受控开放权重评估下转移,并且在很大程度上取决于所使用的模型。组件分析表明,有效的 RAG4SVD 取决于流水线阶段之间的对齐。例如,预言机知识将检索提高到接近最优,但性能仍然很低(0.51 成对准确率),这表明仅检索有效性不足以实现可靠的检测。这些发现不仅促进了对 RAG4SVD 的端到端评估,而且促进了管道组件级别的评估,并为更加标准化、RAG 感知的评估实践提供了基础。