论文
MorphoQuant:全模态的模态感知量化 大语言模型
MorphoQuant: Modality-Aware Quantization for Omni-modal Large Language Models
摘要
由于极端的分布异质性和跨模态的不同异常值模式,传统的 后训练 量化 (PTQ) 方法很难与 4 位全模态 大语言模型 (OLLM) 相媲美。为了解决这个问题,我们提出了 MorphoQuant,一种模态感知 PTQ 框架,旨在保留跨模态形态并减少异常值损失。具体来说,我们引入了分布感知偏差补偿(DABC),它选择性地将长尾异常值吸收到通道偏差中。该机制保护异常值幅度,同时保持密集内部值的高精度离散化,从而在不同的模态分布中保持准确的离散化。作为补充,我们提出形态定向量化函数优化(MDQFO)来共同优化量化网格与偏差掩模,确保跨模态的细粒度对齐。对 Qwen2.5-Omni 跨 MMMU 和 Video-MME 等基准的广泛评估证明了我们方法的优越性。值得注意的是,我们的 W4A4 模型在 ScienceQA 上达到了 76.63%,显着优于 SOTA W4A4 方法,并令人惊讶地超过了 W4A16 基线,这充分证明了我们的框架卓越的准确性与效率权衡。