论文
通过双投影进行封闭形式概念擦除
Closed-Form Concept Erasure via Double Projections
摘要
虽然基于扩散的架构等现代生成模型已经实现了令人印象深刻的创造力,但它们也带来了重要的安全和道德风险。这些担忧导致人们对概念擦除(从模型表示中删除不需要的概念的过程)越来越感兴趣。现有的方法通常可以实现强大的擦除性能,但依赖于迭代优化,并且可能会无意中扭曲不相关的概念。在这项工作中,我们提出了一个简单但有原则的替代方案:一个线性转换框架,无需任何训练即可通过分析实现概念擦除。我们的方法通过两个连续的封闭式步骤来调整预训练模型:首先,计算目标概念的代理投影,其次,在已知概念方向的左零空间内应用约束变换。该设计产生了确定性和几何可解释的程序,用于安全、高效和基于理论的概念去除。在广泛的实验中,包括多个稳定扩散变体和流匹配模型(FLUX)上的对象和样式擦除,我们的方法匹配或超越了最先进方法的性能,同时更忠实地保留非目标概念。只需几秒钟即可应用,它提供了一种用于受控模型编辑的轻量级嵌入式工具,从而推进了更安全、更负责任的生成模型的目标。