论文
面向文生图扩散Transformer的鲁棒且可泛化的安全引导
Robust and Generalizable Safety Steering for Text-to-Image Diffusion Transformers
摘要
扩散Transformer(Diffusion Transformer)已成为文生图生成的强大骨干网络,但其分层且跨模态的生成过程使安全控制从根本上不同于提示层过滤或输出层检测。有害语义可能在文本表示中表达微弱,逐步绑定到视觉潜变量上,最终与渲染动态纠缠在一起。因此,在固定层进行安全引导可能不稳定,且从已知风险学到的引导机制未必能可靠迁移到发生偏移的目标风险域。我们提出SafeDIG,一个将DiT安全适配形式化为位置感知稀疏特征迁移的安全引导框架。SafeDIG首先在功能各异的DiT干预位置上构建稀疏自编码器(SAE),并通过鲁棒性感知的预训练路由优先选择在源—目标风险偏移下预计仍能保持稳定的干预位点。随后,它将SAE编码器冻结为可复用的稀疏安全字典,仅将解码器适配到目标域的激活流形,从而把可迁移的安全特征与域特异的激活几何分离开。推理时,SafeDIG结合Blend与Repel两种操作,将不安全激活引导至迁移而来的安全流形,或使其远离有害的稀疏方向。在FLUX.1 Dev与Stable Diffusion 3.5 Large上的实验表明,SafeDIG在保持源域安全性与图像质量的同时,持续降低目标域及整体的不安全生成率。
