论文

深层梦想是由此构成的:可视化扩散模型中的单义特征

Deep Dreams Are Made of This: Visualizing Monosemantic Features in Diffusion Models

模型评测模型行为与机制分析

摘要

本文提出了通过优化实现潜在可视化(LVO),这是一种机械可解释性技术,通过优化将特征可视化(最初是为卷积神经网络开发的)扩展到潜在扩散模型。 LVO 采用稀疏自动编码器 (SAE) 将多语义层表示分解为单语义特征。主要贡献包括潜在空间优化、时间步活动分析、计划匹配噪声注入、通过特征引导进行预先初始化以及合适的正则化策略。我们演示了在 Style50 数据集上微调的 Stable Diffusion 1.5 的方法,表明 SAE 特征可以产生可识别概念的清晰可视化 - 包括对角线构图、人物、玫瑰、电缆和瀑布泡沫 - 与数据集示例相关,而没有解开的基线会产生不太连贯的结果。我们进一步表明,正则化技术从像素空间特征可视化转移到潜在域,尽管它们需要原始层和 SAE 变体的不同配置。与数据集示例和指导相比,LVO 通过直接揭示激活功能的因素而不是其下游影响来提供补充见解。