论文
Skin-Deep:大语言模型表示中对齐脆弱性的几何诊断
Skin-Deep: A Geometric Diagnostic for Alignment Fragility in Large Language Model Representations
摘要
对齐调优意在使有害请求拒答稳健——但该安全行为可被一小组良性微调示例抹除。这对开放权重模型是部署风险——因为检查点可在发布时通过拒答测试——之后在低成本下游微调下失去拒答。先前工作已确立这些拒答失败——但既有研究未展示如何在攻击或微调干预运行之前——从对齐模型自身检测该脆弱性。我们引入Skin-Deep——几何诊断:在干预运行前直接从对齐模型的隐藏态激活检测对齐脆弱性——并把层级安全几何压缩为单一标量——几何脆弱性分数(GFS)。应用于横跨六种对齐配方、3B-32B参数的21个指令微调模型——Skin-Deep揭示跨模型家族复现的低秩安全子空间。方向消融表明移除该子空间中的方向会削弱有害请求拒答——提供恢复的几何支撑拒答行为的因果证据。关键的是——GFS在任何微调之前识别出经小规模LoRA微调后保留最多拒答的初始安全模型。这些结果确立GFS为实用的部署前诊断——无需运行攻击即可标记脆弱拒答行为。