论文
SACE:视觉自回归模型中语义奇点的概念擦除
SACE: Concept Erasure at the Semantic Singularity in Visual Autoregressive Models
摘要
视觉自回归(VAR)模型的快速发展为高保真文本到图像合成打开了一个变革前沿,同时也加剧了对生成内容的安全对齐的担忧。将现有擦除技术简单地应用于 VAR 模型会导致灾难性的语义崩溃和视觉伪影,因为它们主要是为扩散模型的同质去噪步骤而设计的。为了解决这一基本挑战,我们首先提出语义奇点公理,该公理假设提示中嵌入的任何目标语义概念都明确锁定在 Scale-0。然后通过我们提出的增量语义显着性分析(ISSA)严格验证该公理,这也使社区能够透明地检查从粗到细的语义注入过程。在这一见解的指导下,我们为 VAR 模型引入了第一个规模感知概念擦除框架 (SACE)。通过严格限制干预措施到第一个尺度,我们的方法结合了熵正则化擦除目标以防止高熵采样退化,同时恢复性保存损失以安全地锚定纠缠良性先验的完整性。大量实验表明,我们的方法以最小的训练开销实现了跨各个领域的外科概念擦除性能,及时而巧妙地解决了新兴 VAR 架构中固有的关键安全漏洞。代码位于:https://github.com/limerenceysy/SACE}{https://github.com/limerenceysy/SACE。