论文
十年内的拉锯战:通过教师引导的检索增强一代解决漏洞分析中的冲突
Tug-of-War within A Decade: Conflict Resolution in Vulnerability Analysis via Teacher-Guided Retrieval-Augmented Generations
摘要
大语言模型 (LLM) 对于分析和解决网络安全漏洞至关重要。然而,在过去十年中发现的超过20万个漏洞中,有超过3万个已被更改或更新。这就需要经常更新LLM的训练数据集和内部知识库,以保持知识的一致性。在本文中,我们重点关注CVE(常见漏洞和暴露)检测和分析中的知识差异和冲突问题。这个问题阻碍了LLM从原始训练数据集中检索最新知识的能力,导致知识冲突、捏造事实不正确的结果以及产生幻觉。为了解决这个问题,我们提出了一种创新的两阶段框架,称为 CRVA-TGRAG(通过教师引导检索增强生成解决漏洞分析中的冲突)。首先,为了提高检索阶段的文档检索准确性,我们利用父文档分割和基于语义相似性和倒排索引的集成检索方案。其次,为了增强 LLM 基于生成阶段 CVE 数据集检索的能力,我们采用教师引导的偏好优化技术来微调 LLM。我们的框架不仅通过RAG提高了内容检索的质量,而且还利用LLM中偏好微调的优势来更有效、更准确地回答问题。实验表明,与外部知识库相比,我们的方法在检索最新 CVE 方面具有更高的准确性。总之,我们的框架显着减轻了仅依赖 LLM 进行知识检索可能引起的潜在知识冲突和不一致。