论文

揭秘并修复 LLM 在环漏洞

Towards Demystifying and Repairing LLM-in-the-Loop Vulnerabilities

模型评测安全与风险评测

摘要

大语言模型(LLM)已作为关键组件积极集成到现代软件系统中,引入了一种新型软件漏洞——LLM-in-the-Loop(LiL)漏洞,其中威胁是由LLM引起的。尽管一些研究试图调查 LiL 漏洞的影响,但不幸的是,他们未能清楚地区分 LiL 漏洞与传统漏洞,使得对现实世界 LiL 漏洞的理解成为一个悬而未决的问题。为了解决这一差距,我们首先明确定义LiL漏洞的范围,并讨论LiL漏洞与LLM系统中存在但并非真正由LLM引起的漏洞(即LLM生态系统漏洞)之间的区别。然后,我们构建了第一个LiL漏洞数据集LiLCVE,涵盖41个LiL漏洞和75个LLM生态系统漏洞,以方便对LLM集成软件进行风险分析。 LiLCVE分析表明,LiL漏洞比LLM生态系统漏洞和传统软件漏洞的严重性更高,分别高出15.5%和30.3%。此外,考虑到 LiL 漏洞的严重性以及基于 LLM 的漏洞修复方法在修补传统软件漏洞方面的潜力。我们探索了现有广泛使用的基于 LLM 的方法修复 LiLCVE 漏洞的能力。 20 个代理模型配置的实验结果表明,LiL 漏洞的修复难度要大得多,与其他类型的漏洞相比,Pass@1 率平均下降 10.8%。更关键的是,生成的查询执行、代理操作和模型输出渲染这三个类别的修复成功率经常为 0%。