论文
FourTune:针对扩散模型实现完全 4 位高效 后训练
FourTune: Towards Fully 4-Bit Efficient Post-Training for Diffusion Models
摘要
扩散模型已成为高质量生成建模的主导范例,而 后训练 对于使其适应不同的下游应用至关重要。然而,由于内存占用过高和训练速度缓慢,大型扩散模型的 后训练 仍然具有挑战性,而现有的参数高效 微调 方法只能部分解决这些问题。为了克服这些限制,我们提出了 FourTune,这是一种基于端到端 W4A4G4 范式的高效 后训练 扩散模型框架。 FourTune 引入了三分支混合管道,该管道通过冻结数值稳定器增强了标准 LoRA 架构,以隔离量化敏感的异常值,从而在本机 4 位计算下实现稳定的训练。此外,FourTune 采用硬件高效的逐块量化和定制的融合内核来支持高效的量化反向传播并减少内存带宽开销。在定制、强化学习和 蒸馏 任务中,FourTune 与全精度 微调 的质量相匹配。在 FLUX.1-dev (12B) 上,与 BF16 LoRA 相比,FourTune 将内存开销减少了 2.25$\times$,并将端到端训练吞吐量增加了 2.27$\times$。