ElasticDiT:通过弹性架构和稀疏注意力实现高效扩散 Transformer,在移动设备上生成高分辨率图像
ElasticDiT: Efficient Diffusion Transformers via Elastic Architecture and Sparse Attention for High-Resolution Image Generation on Mobile Devices
摘要
Diffusion Transformer (DiT) 架构是最先进的高保真图像生成范例,支撑着 Stable Diffusion-3 和 FLUX.1 等模型。然而,在资源有限的移动设备上部署这些模型会带来高昂的计算和内存开销。虽然 Linear-DiT 和静态剪枝等效率驱动的方法可以缓解瓶颈,但它们通常会导致质量下降。与云环境不同,移动约束需要动态平衡保真度和延迟的单一模型范例。我们引入了 ElasticDiT,它通过调整空间压缩比和 DiT 块深度来实现这种动态权衡。通过集成 Shift Sparse Block Attention (SSBA) 和 Tiny DWT-Distilled VAE (T-DVAE),ElasticDiT 减少了推理延迟和内存占用,同时保持了图像质量。实验证实,ElasticDiT 在一组参数内有效地涵盖了广泛的保真度与延迟之间的权衡。通过联合调整压缩和深度,单个 ElasticDiT 模型可以动态重新配置,以超越特定于任务的基线。具体来说,我们的 Flex lite 变体的 HPS 达到了 32.87,超越了 Flux 模型,同时通过 SSBA 保持了 84.16% 平均稀疏度的竞争质量。此外,即插即用的 T-DVAE 提供 SD3 级重建,计算成本仅为标准 VAE 的 1/8 倍,Flow-GRPO 增强了语义对齐(GenEval:66.93 至 73.62)。这些结果表明,ElasticDiT 提供了一种多功能、硬件自适应的解决方案,无需多个专用模型,为未来在移动设备上生成高分辨率图像提供了一条有前景的道路。