论文

SafeRoPE:特定风险的头向嵌入旋转,用于整流流中的安全生成 Transformer

SafeRoPE: Risk-specific Head-wise Embedding Rotation for Safe Generation in Rectified Flow Transformers

模型推理解码与生成控制

摘要

最近基于整流流 Transformer(例如 SD3、FLUX)的文本到图像(T2I)模型实现了高生成保真度,但仍然容易受到不安全语义的影响,特别是在由多词元交互触发时。现有的缓解方法很大程度上依赖于 微调 或注意力调制来进行概念忘却;然而,它们昂贵的计算开销和针对基于 U-Net 的降噪器量身定制的设计阻碍了对基于 Transformer 的扩散模型(例如 MMDiT)的直接适应。在本文中,我们对 MMDiT 中的注意力机制进行了深入分析,发现不安全语义集中在头部级别的可解释的低维子空间中,其中一组有限的安全关键头部负责不安全特征提取。我们进一步观察到,扰动应用于查询和关键向量的旋​​转位置嵌入(RoPE)可以有效地修改生成图像中的一些特定概念。受这些见解的启发,我们提出了 SafeRoPE,这是一种轻量级、细粒度的 MMDiT 安全生成框架。具体来说,SafeRoPE 首先通过分解安全关键头中的不安全嵌入来构造头级不安全子空间,并通过投影到这些子空间上计算每个输入向量的潜在风险评分 (LRS)。然后,我们引入头部 RoPE 扰动,它可以抑制不安全的语义,而不会降低良性内容或图像质量。 SafeRoPE 结合了 head-wise LRS 和 RoPE 扰动,对查询和关键向量嵌入执行特定风险的 head-wise 旋转,从而能够精确抑制不安全输出,同时保持生成保真度。大量实验表明,SafeRoPE 在平衡有效有害内容缓解和安全生成 MMDiT 的实用程序保留方面实现了 SOTA 性能。代码可在 https://github.com/deng12yx/SafeRoPE 获取。