论文
安全补丁检测的代码语言模型的综合评估
A Comprehensive Evaluation of Code Language Models for Security Patch Detection
摘要
自动检测漏洞修复提交 (\vfcs) 对于及时部署安全补丁至关重要,因为咨询数据库滞后补丁发布平均 25 天,而且许多修复从未收到建议。代码语言模型越来越多地用于识别 VFC,但它们是否能够从代码更改本身识别安全修复仍不清楚,因为报告的性能是由提交消息、项目级数据泄漏和不确定的数据质量决定的。我们提出了严格的重新评估,通过一个统一的框架来共同控制这些因素,该框架整合了涵盖超过 180000 次提交的 20 个碎片数据集。我们训练了 125M 到 80B 参数的 270 个模型,在组分层的仅代码评估下隔离代码信号,并评估模型容量和附加代码上下文的影响,范围从过程内丰富到过程间存储库上下文。模型容量产生明显但不足的收益,并且评估的上下文信号在严格的误报预算下没有提供可靠的改进。在误报率为 0.5% 的情况下,每个经过评估的微调纯代码模型都会错过至少 80% 的漏洞修复。手动专家审核进一步表明,标签错误集中在缺乏 CVE 关联的提交中,并且主要扭曲了评估。我们得出了评估聚合 VFC 数据集的具体建议,并发布了我们的统一框架和评估套件。