论文

对自动化安全补丁反向移植进行基准测试:我们还有多远?

Benchmarking Automated Security Patch Backporting: How Far Are We?

模型评测基准与评测资源

摘要

自动安全补丁反向移植对于缓解 N 天漏洞至关重要。最近的工具报告在各自的数据集上的成功率超过 80%。然而,这些评估通常仅限于同质环境,例如一个存储库或特定项目版本。因此,目前尚不清楚这些工具在超出其最初目标场景之外的推广效果如何。我们提出了 Porting Benchmark,这是一个包含 1,234 个安全补丁反向移植案例的精选数据集,涵盖跨版本、跨分支和跨存储库场景,并配有通用评估框架。使用此基准,我们评估了五种工具,涵盖程序分析、LLM 提示和一致设置下的 LLM 代理。我们的结果表明,一致的评估改变了明显的性能格局:PortGPT 和 TSBPort 在复制数据集上仍然相对较强,而 FixMorph 和 Mystique 在通用协议下大幅下降。结构复杂的补丁的性能急剧下降:最佳提交级别成功率从 Type-I 补丁的 85.2% 下降到 Type-IV 的 24.0%。我们确定了四个根本原因类别(缺少目标 API 意识、跨版本语义不匹配、非本地依赖关系传播失败以及补丁构建或本地化失败),并得出下一代工具设计的具体方向。在具有经过验证的测试用例和构建的 POC 的 45 个动态验证子集上,我们进一步观察到基于参考的基准分数并未完全捕获现实世界的修复:精确匹配严重低估了更困难的目标适应,而可执行验证则揭示了静态参考协议遗漏的目标中的残余集成失败。可执行反馈细化为最困难的可执行案例提供了有限但可衡量的恢复。