论文

用于解释扩散模型的残差时间稀疏自动编码器

Residualized Temporal Sparse Autoencoders for Interpreting Diffusion Models

模型评测模型行为与机制分析

摘要

文本到图像的扩散模型通过迭代去噪过程生成图像,因此内部神经层产生激活轨迹而不是单个静态表示。稀疏自动编码器(SAE)最近被用来将扩散激活分解为可解释的特征方向,但大多数方法分析单个时间步长或时间条件的激活,而不是直接从完整的激活轨迹中学习。在这项工作中,我们引入了用于扩散激活轨迹的残差时间 SAE。我们收集去噪时间内的激活,在相邻时间步长之间拟合线性预测器,并使用初始激活以及这些线性动力学无法解释的残差分量来表示每个轨迹。在这种残差表示上训练 SAE 可以鼓励稀疏潜在变量捕获超出线性可预测范围的结构。残差解码器方向可以映射回激活空间,从而允许将每个潜在特征作为去噪时间内的特征轨迹进行分析。通过重建和消融研究、时空特征分析以及稳定扩散~1.5 的定性转向实验,我们表明残差时间 SAE 为研究时间结构扩散激活提供了一个有用的框架。