论文

解释文本到图像扩散模型中与对象相关的概念脆弱性

Interpreting Object-Dependent Concept Brittleness in Text-to-Image Diffusion Models

模型评测模型行为与机制分析

摘要

尽管文本到图像扩散模型通常表现出很强的提示跟随能力,但我们发现了一种持久且先前未充分探索的故障模式,其中仅在对象中不同的一小部分提示始终无法在相同的生成设置下实现相同的目标概念。我们将这种现象称为对象相关概念脆弱性。这种情况表明系统的内部盲点而不是随机采样噪声。在本文中,我们提出了一个面向可解释性的框架来审核并最小程度地纠正这些故障。我们的关键思想是分析逐步稀疏自动编码器(SAE)空间中的去噪轨迹,其中抽象样式和属性概念比原始去噪表示更加可分离。这种稀疏的空间使我们能够比较成功和失败的一代,识别其证据缺失、减弱或暂时延迟的概念维度,并从可靠的类一致样本构建类级概念原型。基于此审核过程,我们引入了一种轻量级推理时间校正策略,该策略将去噪特征插值到 SAE 空间中的相应原型。这种干预不是作为特定任务的重新训练方法,而是作为对诊断出的概念缺陷的验证。我们评估了跨多个扩散主干的样式和属性失败案例所提出的框架,在概念一致性、文本保真度和修复成功方面取得了显着改进。进一步的分析表明,更深层次的去噪表示提供了更清晰的概念结构,而早期干预提供了最强的校正杠杆。代码可在 https://github.com/Metecade/Object-Dependent-Concept-Brittleness 获取。