论文

使用统一自适应 蒸馏 进行量化,以实现基于多个 LoRA 的一对一边缘生成视觉模型

Quantization with Unified Adaptive Distillation to enable multi-LoRA based one-for-all Generative Vision Models on edge

摘要

图像编辑、对象删除和提示引导图像转换等生成人工智能 (GenAI) 功能越来越多地集成到移动应用程序中。然而,由于内存和计算要求较高,在资源受限的设备上部署大型视觉模型 (LVM) 来执行此类任务仍然具有挑战性。虽然低秩适配器 (LoRA) 可实现参数高效的任务适应,但现有的移动部署管道通常会为每个 LoRA + 基础模型的副本编译单独的模型二进制文件,从而导致冗余存储并增加运行时开销。在这项工作中,我们提出了一个统一的框架,用于使用单个共享模型在边缘设备上启用多任务 GenAI 推理。我们的关键思想是将 LoRA 权重视为运行时输入,而不是将它们嵌入到已编译的模型图中,从而允许在运行时动态任务切换而无需重新编译。然后,为了支持高效的设备上执行,我们引入了 QUAD(统一自适应 蒸馏 量化),这是一种量化感知训练策略,可在共享量化配置文件下对齐多个 LoRA 适配器。我们使用与移动 NPU 兼容的轻量级运行时堆栈来实现所提出的系统,并跨多个芯片组对其进行评估。实验结果表明,内存占用量和延迟分别减少了 6 倍和 4 倍,同时在多个 GenAI 任务中保持高视觉质量。