论文

安全错误报告识别自动化技术的比较分析

A comparative analysis of automated techniques for security bug report identification

模型评测模型能力评测

摘要

及时识别与安全相关的错误报告对于最大限度地减少软件系统中的漏洞窗口至关重要。对于大型软件系统来说,手动筛选传入的错误报告以识别与安全相关的问题非常耗时、容易出错且不可扩展。因此,人们提出了各种自动化技术来促进这项任务,包括传统的机器学习(ML)技术和大语言模型。然而,文献仍然支离破碎。大多数研究引入或优化特定技术,并通常在不同的实验设置下根据一组有限的基线对其进行评估。因此,很难比较他们的结果并就现有方法的有效性得出可靠的结论,使得研究人员和从业者无法明确指导哪些技术最适合该任务。为了解决这一差距,我们对几种有前途的自动化技术进行了比较分析,以使用基准数据集识别与安全相关的错误报告。我们评估了逻辑回归、支持向量机、随机森林、OpenAI 的 GPT-5.2、BERT-base、RoBERTa 和 SetFit(最先进的少样本学习框架)。我们的结果表明,SetFit 实现了最佳的整体性能,F1 得分为 0.80,并且在四个数据集中的三个上优于其他技术。 RoBERTa 的表现具有竞争力,并且在某些项目中接近 SetFit,而传统的 ML 技术(尤其是逻辑回归)在某些情况下仍然是强大的基线。相比之下,GPT-5.2 在零样本和少样本设置中表现不佳。此外,跨项目实验表明,迁移学习可以提高数据有限的项目的性能,但可能会降低具有强烈项目特定特征的项目的结果。