论文

当安全几何崩溃时:Agentic Guard 模型中的 微调 漏洞

When Safety Geometry Collapses: Fine-Tuning Vulnerabilities in Agentic Guard Models

模型评测安全与风险评测

摘要

在完全良性数据上进行微调的防护模型可能会失去所有安全一致性——不是通过对抗性操纵,而是通过标准领域专业化。我们通过三个专门构建的安全分类器(LlamaGuard、WildGuard 和 Granite Guardian)证明了这一失败,这些分类器部署为代理 AI 管道中的保护层,并表明它源于潜在安全几何结构的破坏:指导分类的结构化有害-良性表征边界。我们通过类条件激活差异的 SVD 提取每层安全子空间,并跟踪该边界在良性 微调 下如何演变。 Granite Guardian 经历了彻底崩溃——拒绝率从 85% 下降到 0%,CKA 下降到零,100% 的输出变得模糊——严重程度超过了之前对通用 LLM 的发现,用专业化假设来解释:集中的安全表示是有效的,但极其脆弱。为了缓解这个问题,我们提出了费舍尔加权安全子空间正则化(FW-SSR),这是一种训练时间惩罚,结合了(i)从对角费舍尔信息导出的曲率感知方向权重和(ii)随任务安全梯度冲突扩展的自适应$λ_t$。 FW-SSR 通过主动锐化安全子空间而不是仅仅锚定它,在花岗岩守护者 (CKA = 0.983) 上恢复了 75% 的拒绝率,并将 WildGuard 的攻击成功率降低至 3.6%(低于未修改的基线)。在所有三个模型中,结构表征几何(CKA、Fisher 评分)比绝对位移指标更可靠地预测安全行为,从而将基于几何的监控建立为代理部署中防护模型评估的必要组成部分。