论文

DifFRACT:电路追踪的扩散特征重建和归因

DifFRACT: Diffusion Feature Reconstruction and Attribution for Circuit Tracing

模型评测模型行为与机制分析

摘要

机械可解释性旨在通过将模型计算分解为可解释的特征和电路来解释神经网络行为。虽然基于转码器的电路追踪最近已经能够对 大语言模型 进行详细的因果分析,但用于图像生成的多模态扩散 Transformer 仍然相对不透明。我们仍然缺乏工具来理解语义信息如何跨降噪步骤传播以及文本和图像表示如何在双流 MM-DiT 架构中交互。现有方法仅提供部分洞察:注意力图暴露了词元交互的有限视图,而稀疏自动编码器可以发现可解释的特征,但不能直接揭示这些特征如何通过非线性 MLP 层进行转换和组合。在这项工作中,我们将基于转码器的电路跟踪扩展到多模态扩散 Transformer。我们训练时间步条件转码器,忠实地近似 FLUX.1[schnell] 中 MLP 子层的输入输出行为。通过用转码器替换 MLP 并对剩余计算进行线性化,我们获得了精确的特征到特征归因并恢复紧凑、可解释的电路。根据经验,我们的转码器在稀疏性-忠实性 权衡上匹配或稍微优于稀疏自动编码器。由此产生的电路揭示了属性绑定和跨流语义传播的机制,并为系统生成错误提供了因果解释。此外,电路引导干预比标准的基于 SAE 的转向更加精确和有效。我们的结果表明,基于转码器的电路分析对于最先进的扩散 Transformer 是可行的,并为理解和控制多模态生成模型提供了强大的框架。代码可在 https://github.com/Artalmaz31/DifFRACT 获取