用于少步扩散模型的可分解探针:跨骨干系列和 蒸馏 范式的即时、潜在和评分选择性
A Decomposable Probe for Few-Step Diffusion Models: Prompt, Latent, and Score Selectivity across Backbone Families and Distillation Paradigms
摘要
少步蒸馏扩散的学生将文本到图像的推理从约 50 个网络评估减少到 1-8 个网络评估,但质量差距通常由单个 FID/CLIP 标量来概括,该标量无法说明条件响应的哪个轴发生了变化,也无法说明行为是否来自架构、蒸馏 目标,或者仅仅是来自扩散模型。我们用可分解探针替换标量,该探针在三种模式(均值、方差、尺度)和六种强度下沿三层(提示编码器、降噪器输入、降噪器输出)注入受控扰动,报告 Inception 特征上的自举中值 Bures W2^2 选择性比。在跨 23 个模型的单个匹配估计器下——五名教师和 18 名精炼学生,涵盖五个骨干系列(SDXL、SD1.5、SD3.5、PixArt-alpha、FLUX)、三个架构类别(UNet、DiT、MMDiT)和五个 蒸馏 范式——这三层读取三个经验上可分离的因素:提示层是一个通用的提示均值响应(一个理智通道,而不是一个通道)。判别器),潜在层读取预测类型,评分层读取 蒸馏 目标。我们的主要结果:在这次扫描中,潜在层是整流流主干的近二元检测器。仅对于整流流模型(SD3.5、FLUX),其比率在持续的中低频段上超过 1;没有 epsilon 预测模型符合条件。匹配的 epsilon 预测控制 (PixArt-alpha) 排除了宽 T5 调节,并且指纹在作为教师和学生的对抗性 (ADD) 蒸馏 中幸存下来。两个次要评分层发现适用于较小的范围:具有非 ADD 基线的 UNet 家族的规范 4 步 ADD与其余方法对比,以及 UNet 和 DiT 上的 CI 分离轨迹展开早期强度分数峰值。所有比率均在一个估计量下可引用 CI;我们发布了每个单元格的表格和估计器。