论文

使用稀疏自动编码器来消除扩散模型中的学习,但不要触摸

Look But Don't Touch with Sparse Autoencoders for Unlearning in Diffusion Models

模型训练模型编辑与遗忘

摘要

最近,稀疏自动编码器(SAE)被提出作为概念级操作的可解释工具,假设孤立的特征可以作为可控的干预点。在这项工作中,我们在扩散模型中的对象擦除和转向的背景下系统地评估了这一假设。我们表明,虽然 SAE 能够可靠地检测和定位扩散模型激活中的语义概念,但对其潜在空间的直接干预经常会引起分布外激活,从而导致严重的视觉伪影。为了将检测与干预分开,我们纯粹使用 SAE 激活作为语义检测器来识别包含目标对象的图像区域,并将这些补丁嵌入替换为不包含目标对象的补丁嵌入。这种基于检测的替换保留了扩散模型的激活统计数据,并产生比潜在转向更干净的擦除结果。我们的研究结果揭示了扩散模型中概念检测和概念干预之间的根本差距:单语义或稀疏特征本质上不适合作为转向控制旋钮。这些结果将 SAE 定位为分析生成模型的强大可解释性工具,但突显了用于直接操作(例如遗忘)时的重要局限性。