论文
有帮助还是有害?通过人体研究评估 LLM 辅助漏洞修补
Helpful or Harmful? Evaluating LLM-Assisted Vulnerability Patching via a Human Study
摘要
软件漏洞修复是一项认知要求很高的任务,需要一般开发人员通常缺乏的专业安全专业知识。同时,大语言模型(LLM)辅助工具在漏洞检测、定位和修复任务中显示出潜力。 [假设:] 虽然 LLM 协助被假设可以加速修补,但它也有引入幻觉或不安全代码的风险,从而导致更有可能生成绕过标准功能检查但无法通过安全验证的表面修复。 [目标:] 我们旨在提出一项实证实验,揭示 LLM 辅助漏洞修补的能力,与现实场景中人类参与者的手动调试相比。 [方法:]我们计划使用平衡交叉设计进行对照实验。为此,我们开发了一个用于代码执行的 Web 应用程序,并集成了隐藏的 Ghost 测试,以验证超出可见功能要求的补丁完整性。实验涉及训练和评估场景。将评估标准功能测试和安全测试的修复速度、修复效果以及参与者的感知。 [试点研究:] 已经对小样本参与者进行了试点实验,为后续研究提供了见解。