扭转流扩散瓶颈:消费级 GPU 上的视频速率 MLLM 条件编辑扩散
Inverting the Streaming-Diffusion Bottleneck: Video-Rate MLLM-Conditioned Edit Diffusion on a Consumer GPU
摘要
扩散 U-Net 的积极 蒸馏 反转了实时文本到图像管道的每帧瓶颈:一旦降噪器成为 4 步或 1 步蒸馏学生,文本编码器就成为关键路径。这种反转在视觉感知编辑扩散中最为严重,其中编码器是多模态 大语言模型 (MLLM)。我们研究了与 2.13B MLLM 文本编码器 (Qwen3-VL) 配对的 0.39B 蒸馏编辑 U-Net,并提出了该机制的流式管道,该管道建立在三种机制之上,使编码器远离降噪器的关键路径而不是缩小编码器:具有批量文本编码器摊销的非对称侧流/主流 CUDA 管道,一种可编译的 ControlNet-LLLite 重构,可折叠整个 U-Net +适配器堆栈成一个融合图,以及带有钩子子集的定期调节刷新计划,该钩子子集分摊每帧调节成本。在单个消费类 RTX 3090 Ti(512x512)上,在 480 帧运行中可维持 27-30 fps;在相同的工作点上,RTX 4090 上的稳态吞吐量可扩展至 55 fps,RTX 5090 上的稳态吞吐量可扩展至 74 fps。这表明,一旦 蒸馏 足够激进,进一步的增益将来自编码器端系统的工作,而不是进一步的降噪压缩——这与流扩散文献迄今为止优化的杠杆相反。我们报告视频速率流吞吐量,而不是交互式低延迟,并根据作为系统上下文的同一堆栈 StreamDiffusion 重新运行来定位我们的数字,而不是优越性声明。发布的油画适配器将剪辑内噪声概括为来自七个来源的 19 个未使用的 DAVIS-2017 序列和 15 个非 DAVIS 剪辑;对未见过的样式的提示级概括是有限的并单独报告。