论文
NeuronFuzz:用于 LLM 安全评估的安全神经元引导模糊测试
NeuronFuzz: Safety Neuron Guided Fuzzing for LLM Safety Evaluation
摘要
安全评估对于评估对齐的 大语言模型 (LLM) 是否仍然能够抵御越狱攻击至关重要。然而,现有的自动化测试方法在很大程度上依赖于响应级别的反馈:每个候选提示通常需要生成目标模型响应来评估其攻击有效性。这个过程成本高昂,更重要的是,它只为强一致性模型提供稀疏的指导,其中大多数候选者都会因相同的失败结果而被拒绝。本文介绍了 NeuronFuzz,这是一种白盒模糊框架,利用内部安全神经元作为 LLM 安全评估的连续执行反馈。 SafetyOracle 将安全神经元激活转换为连续的安全警报分数,作为模糊测试的反馈,并且可以在预填充期间获得,从而消除了模糊测试循环中的响应生成。为了构建 SafetyOracle,NeuronFuzz 使用模板不变的有害和良性输入以及稳定性感知选择来识别一组紧凑的安全神经元,其激活捕获有害意图识别。此外,由于安全警报分数是可微分的,NeuronFuzz 使用其梯度来识别安全敏感的模板位置,并使用掩码语言模型来生成流畅的、上下文兼容的突变,同时保留原始的有害负载并避免额外的优化变量。我们评估了 21 个文本和多模态模型的 NeuronFuzz。在五个白盒源模型中,它实现了 76-100% 的越狱发现率,比基线高出高达 48 个百分点。其优化模板进一步将零样本转移到开放重量和六个专有目标模型,实现平均 ASR 和 top-5 集成 ASR (EASR) 分别为 69.6%/92.6% 和 44.1%/60.0%。