论文

重量已经结束 - 消费级 GPU 上的交互式扩散

The Weight Is Over - Interactive Diffusion on Consumer GPUs

模型优化端侧模型

摘要

设备端推理正在蓬勃发展,但其势头几乎全部集中在语言模型中。扩散管道需要大量内存、对延迟敏感,并且需要编排嵌入器、转换器、解码器,并且通常还需要进一步的后处理,而这些后处理并不像 LLM 推理循环那样标准化。我们在性能、质量和模型占用空间之间进行权衡,以在野外覆盖尽可能多的客户端设备。我们做出了三项贡献:嵌入翻译器,将小型文本编码器映射到大型编码器空间以减少重量和延迟;用于导航扩散管道中的速度/质量/内存三角的可重复扫描方法;以及交互式设备图像生成编辑器,可在最新 GPU 上实现亚秒级 TTFI。