论文

模型共享安全表示吗?用于安全视觉生成的跨模型转向

Do Models Share Safety Representations? Cross-Model Steering for Safe Visual Generation

模型推理解码与生成控制

摘要

生成建模的最新进展使安全控制成为一个核心挑战,但现有方法在很大程度上仍然是特定于模型的,需要对每个新架构进行再培训或量身定制的干预措施。在这项工作中,我们询问安全性是否可以表示为可移植的潜在方向,学习一次并在异构生成器中重用。我们引入了第一个跨模型安全引导框架,其中根据成对的安全-不安全提示在源 LLM 中估计安全方向,通过仅安装在良性数据上的轻量级对齐传输到目标生成器,并在推理时应用。至关重要的是,我们的管道永远不会访问目标端的不安全数据,从而隔离是否可以通过共享表示几何体传输安全性。除了单一的全局方向之外,我们还确定了一个多向量扩展,可以捕获特定类别的安全行为,从而实现更具选择性的控制。我们评估了跨不同源-目标模型对的文本到图像和文本到视频生成的方法。在模型中,转移的安全方向可实现 ASR 减少和 CLIP-Score/FID 权衡,与使用不安全数据在目标模型上本地学习的方向相当,同时不需要目标端不安全数据。这表明安全性的提高不会以牺牲生成质量为代价。我们的结果指出了安全的模块化观点:与安全相关的行为并不纯粹是模型本地的,而是可以通过跨模型持续存在的潜在方向来控制。这为不需要目标端不安全数据的轻量级、可重用安全机制提供了一条新途径。