论文
DiTango:具有选择性注意状态重用的经济高效的并行扩散生成
DiTango: Cost-Effective Parallel Diffusion Generation with Selective Attention State Reuse
摘要
AI 生成内容的最新进展推动了 Diffusion Transformer (DiTs) 的广泛采用,用于生成高分辨率、长时间的内容。虽然并行化技术加速了扩散推理,但由于多节点环境中的通信开销过多,它们面临着重大的可扩展性挑战。我们观察到上下文并行性(CP)中的序列分区表现出明显的异质性:空间上邻近的分区对注意力计算结果的贡献更大。通过将这种异构模式映射到分层通信拓扑,我们可以以降低的通信成本访问高贡献分区。这种见解激发了我们新颖的选择性注意力状态机制,该机制战略性地平衡去噪步骤中的部分注意力计算和历史结果重用。我们推出了 DiTango,一种用于 DiT 生成的高效并行框架。 DiTango 具有一个锚引导的状态选择规划器,可以优化每个分区的计算重用决策,并辅以编排高效的以状态为中心的操作的运行时。该设计实现了卓越的系统效率,同时保持了生成质量。对流行扩散模型的实验评估表明,DiTango 在多节点设置中通过近线性缩放实现了高达 1.9 倍的端到端和 3.2 倍的注意力加速,同时保持了与最先进方法相当的生成质量。