论文

AttnRouter:MMDiT 上 无需训练 图像编辑的按类别注意路由

AttnRouter: Per-Category Attention Routing for Training-Free Image Editing on MMDiT

模型推理解码与生成控制

摘要

我们在 Qwen-Image-Edit-2511 上研究 无需训练 图像编辑,Qwen-Image-Edit-2511 是一个 60 块多模态扩散 Transformer (MMDiT),它在单个注意力流中连接噪声和源图像标记。我们做出三项贡献。 (i) 我们引入了 KVInject,一种单前向注意力操作,它将源半键/值投影阿尔法混合到局部层/步带内的噪声半中。 KVInject 比经典的两遍 MasaCtrl 方法更简单,并且避免了在 MMDiT 上禁用 MasaCtrl 的提示不匹配失败模式(与基线相比,综合分数下降了 31%)。 (ii) 我们表明,没有单一的注意力操作在编辑类型中占主导地位,从而激发了 AttnRouter,这是一个按类别的路由表,它将编辑分派给最能保留该类型源结构的操作。通过 真值 类别,路由器将 CLIP-T+DINO-I 复合材料比编辑基线提高了 6.4%;自动 CLIP 零样本分类器弥补了 98% 的差距,尽管类别准确度只有 55%。 (iii) 通过层、步骤和 alpha 波段消融,我们定位编辑有效注意子电路:早期去噪步骤 (S0-7) 中的 K/V 注入几乎恢复了全步注入的所有增益,而早期 (L0-15) 或晚期 (L45-60) 层波段中的注入无法完全驱动编辑; [0.3, 0.5] 中的 alpha 是一个稳定的最佳点。我们还报告了负面结果,强调了未从 UNet 民间传说中转移的内容:简单的 K/V 重新缩放永远不会击败基线,而激进的变体会完全崩溃(综合 0.084)。我们发布了代码、预先计算的路由表以及所有消融中使用的 ImgEdit-Bench 的 100 个样本分层子集。