论文

PersonalQ:面向高效推理的个性化扩散模型选择、量化与服务

PersonalQ: Select, Quantize, and Serve Personalized Diffusion Models for Efficient Inference

摘要

个性化文生图生成让用户能够将扩散模型微调为由特定概念检查点(checkpoint)组成的仓库,但高效服务这些仓库面临两个难点:自然语言请求往往含糊,可能被误路由到视觉上相似的检查点;标准的训练后量化(PTQ)会扭曲编码个性化概念的脆弱表示。我们提出 PersonalQ,一个通过共享信号——检查点的触发词(trigger token)——将检查点选择与量化联结起来的统一框架。Check-in 通过将意图感知的混合检索与基于 LLM 的检查点上下文重排相结合来执行与意图对齐的选择,仅在多种意图仍然皆有可能时提出一个简短的澄清问题;随后通过插入所选检查点的规范触发词来改写提示。与之互补,触发感知量化(TAQ)在交叉注意力中应用触发感知的混合精度,保留由触发词条件化的键/值行(及其注意力权重),同时对其余通路进行激进量化,以实现内存高效的推理。实验表明,PersonalQ 在意图对齐上优于检索与重排基线,而 TAQ 一致地提供比以往扩散 PTQ 方法更强的压缩—质量权衡,从而在不牺牲保真度的情况下实现个性化检查点的可扩展服务。

PersonalQ:面向高效推理的个性化扩散模型选择、量化与服务:论文配图
图1:问题概述:(a)提示需路由到正确个性化checkpoint,现有方法常误路由;(b)训练后量化损伤个性化概念。