论文
DriftScope:测量扩散模型适应的隐藏影响
DriftScope: Measuring The Hidden Effects of Diffusion Model Adaptation
摘要
采用预先训练的文本到图像扩散模型,无论是学习新的视觉概念还是删除不需要的概念,通常都会仅根据其预期效果进行评估。我们认为这个框架是不完整的。通过稀疏自动编码器分析和零样本分类,我们证明了适应系统地损害了语义上不相关的概念,而聚合指标在结构上无法显现出来:当损害严重到足以让 FID 和 KID 做出响应时,模型已经几乎无法使用;当模型保持功能时,FID 和 KID 保持平稳,而特定类别默默地承受最坏情况下的零样本精度下降高达 18.9 个点,并且概念级分布发生巨大变化。这种模式出现在适应谱的两端(概念定制和概念遗忘),表明它是权重水平修改的系统结果,而不是任何特定方法的产物。为了在部署之前揭示这种隐藏的偏差,我们引入了 DriftScope,这是一种提示级诊断工具,它采用任意两个模型检查点并返回视觉概念在它们之间变化最大的标记的排名列表。 DriftScope 优化了 词元级 上归因漂移的软提示,无需访问真实数据或模型内部。结果是综合评估无法提供的可解释的、概念级的审计。