论文
CALM:文生图安全的提示局部反事实调制
Keep It CALM: Analyzing the Limits of Global Unsafety in Text-to-Image Generation
摘要
文生图的训练自由安全防护常依赖跨提示泛用的可复用安全信号,如不安全方向或全局毒性子空间。我们对这一全局不安全假设做受控几何分析,揭示一致的覆盖-选择权衡:紧凑的不安全子空间无法覆盖异质的不安全语义,而更宽的聚合会日益扭曲与安全相邻的良性提示。受此启发,我们提出CALM(反事实自适应局部调制),以提示局部的反事实校正取代统一的全局移除:用匹配的不安全-良性锚点把每个提示路由到激活的不安全类别,只把违规token表示最小编辑到安全侧,并抑制正向对齐的不安全残差分量。在广泛评估中,CALM在保持良性效用的同时显著改善不安全内容抑制,表明局部反事实校正为全局不安全信号移除提供了更有选择性的替代。