论文

E-PMQ:具有合并权重锚定的专家引导合并后量化

E-PMQ: Expert-Guided Post-Merge Quantization with Merged-Weight Anchoring

摘要

低资源部署限制使得模型量化对于在保持性能的同时部署神经网络至关重要。同时,模型合并已成为一种日益实用的低资源策略,用于将多个任务或领域专业专家集成到单个模型中,而无需联合训练或多模型服务。量化和模型合并将多个专家集成到一个低位模型中,从而实现高效的低资源部署管道。我们将此设置表述为合并后量化 (PMQ)。我们证明,直接将 后训练 量化(PTQ)应用于合并模型是不可靠的,因为两个不同的偏差是耦合的:低位重建引入的量化偏差和从模型合并继承的专家相对合并偏差。为了减轻这些偏差,我们提出了 E-PMQ,这是一种专家引导的 PMQ 框架,它使用源专家权重在分层校准期间提供专家引导的输出目标,并结合合并权重锚定来稳定校准并保留合并模型的集成行为。在 CLIP-ViT-B/32 八任务合并上,E-PMQ 将 4 位 GPTQ 在任务算术下从 65.0% 提高到 73.6%,在 TIES-Merging 下从 69.1% 提高到 74.8%。在较难的设置上,E-PMQ 将 20 任务 CLIP-ViT-L/14 上的 GPTQ 从 34.8% 提高到 76.7%,将 FLAN-T5-base GLUE 上的 GPTQ 从 78.26% 提高到 83.34%。这些结果表明 E-PMQ 可实现有效的合并后量化和低位部署。