超越拒绝:用于漏洞分析的对齐和删除 LLM 的同系研究
Beyond Refusal: A Same-Lineage Study of Aligned and Abliterated LLMs for Vulnerability Analysis
摘要
大语言模型 (LLM) 辅助软件安全在一个困难的边界上运行:合法代码审查、分类和修复所需的漏洞分析术语与滥用相关的术语非常相似。在这种情况下,现有的安全和网络安全评估很难解释,因为它们经常比较不相关的模型系列,从而将安全行为与架构、规模、训练数据和部署的差异混为一谈。为了隔离这个因素,我们研究安全状态:在同谱系模型中,拒绝行为是否保持完整(对齐)或已被拒绝消除(消除)。我们询问这种安全状态如何影响整个软件安全工作流程的防御效用。我们将对齐的指令调整模型与来自两个模型家族 Gemma 和 Qwen 的公开发布的拒绝消除后代进行比较。我们评估漏洞检测、CWE 归因、漏洞线路定位、根本原因定位和可执行补丁验证方面的对齐和消除状态。我们进一步将提示措辞视为受控框架维度:提示以中性代码审查语言开始,添加授权上下文,并改变网络安全术语的密度。在基于 Gemma 的 Java/Vul4J 修复验证研究中,Abliterated 实现了更高的早期验证率,分别有 67.8%、65.0% 和 32.8% 的补丁被判断为可用、成功应用和成功编译,而 Aligned 的这一比例分别为 29.9%、24.9% 和 9.0%。在 Qwen 对中,Abliterated 提高了定位性能,将线路级 F1 从 2.08% 提高到 3.91%,将 Top-1 准确率从 4.10% 提高到 6.95%。这些发现表明,对基于 LLM 的安全助手的评估应联合衡量模型是否响应、其可用响应是否正确以及其输出在整个工程工作流程中是否保持可操作性。