论文

端侧语言模型的安全有多脆弱?安全敏感参数的局部故障分析

How Fragile Is On-Device Language Model Safety? Localizing Safety-Critical Parameters for Sparse Fault Analysis

模型评测模型优化端侧模型模型行为与机制分析安全与风险评测

摘要

随着小语言模型 (SLM) 越来越多地部署在资源受限的设备上平台上(包括作为 Agentic 系统的组件),本地存储的模型参数的完整性成为一个重要的安全问题。我们研究 LLaMA-2-7B-Chat 中的安全敏感行为是否集中在参数的稀疏子集中,从而为目标分析创建减少的故障表面。我们研究了两种互补的定位方法:低秩安全相关子空间分析和参数级安全-效用重要性过滤。这两种方法都揭示了整个网络中高度不一致的安全敏感性,MLP down_proj 始终作为突出的安全敏感组件而出现,而 o_proj 提供了较小的贡献。使用参数级本地化,仅修改 down_proj 中模型权重的 0.19% 即可产生 53% 的基本 ASR 和 56% 的 GCG ASR,而与未修改的基线的 52.2% 相比,tinyBenchmarks 的准确率仍保持在 51.6%。这些结果激发了对部署在资源受限、设备上和 Agentic 设置中的语言模型进行有针对性的故障分析和选择性完整性保护。