论文

扩散组合生成中的诊断位置与控制位置分离

Where to Look Is Not How to Fix: Pre-Denoising Diagnostics and Modality-Dependent Control in Diffusion Composition

模型评测模型行为与机制分析

摘要

理解文生图扩散的组合失败,需要同时识别哪里能检测到压力、以及干预如何改变输出。我们通过受控锚点—压力协议共同评估文本编码器诊断和去噪器干预。我们提出纯文本组合压力指数(CSI),在SD1.5、SDXL和SD3文本路径中区分常见与罕见组合,并提供上游诊断坐标。一个匹配的六提示定位研究,将干预位置与不同结果关联:最小化残差的嵌入适配器改善表征拟合,下游跨注意力干预将颜色命中率(CHR)提高0.0272。在SD1.5和SDXL去噪器块中,深层编码器的有符号诊断可访问性均值最大为正,而选择性增强在解码器块获得最大的正均值CHR响应。选择性减去和广泛消融进一步揭示依模态和架构变化的响应,包括广泛消融SDXL解码器跨注意力时CHR明显下降。在受控属性—物体组合设置中,我们发现诊断与控制分离:组合缺陷可在去噪前诊断,但暴露风险的表征坐标不一定是改善生成的坐标或模态。