论文
RGSQ:大型视觉语言模型的黎曼几何敏感量化
RGSQ: Riemannian Geometry-Sensitive Quantization for Large Vision-Language Models
摘要
通过训练后量化 (PTQ),可以在严格的内存和延迟限制下高效部署大型视觉语言模型 (VLM)。然而,大多数 PTQ 方法都是为单峰大语言模型 (LLM) 设计的。这些方法将量化误差视为欧几里德假设下的各向同性扰动,这对 VLM 中的量化最敏感的方向提供了较弱的指导。因此,直接采用单峰 PTQ 方法或单独采用特定于模态的缩放通常会导致位宽分布不均匀以及低位设置中性能不一致。为了应对这些挑战,我们提出了黎曼几何敏感量化(RGSQ),它将量化表述为统一费舍尔-黎曼度量下的重构问题。 RGSQ 通过黎曼流形映射来识别特定于模态的敏感方向,该映射是根据模态划分的经验费希尔因子构建的,并融合到模态感知的 Kronecker 结构度量中。然后,我们应用几何对齐旋转来重新定向局部切线框架,将低位扰动转向对损耗不敏感的轴。最后,我们应用白化变换,将黎曼目标映射到等效的欧几里德形式,使标准单峰 PTQ 方法能够在其原始假设下评估多峰量化误差。在广泛且多样化的主流 VLM 基准测试中,RGSQ 在极低位设置(W2A8 和 W3A8)下实现了最高的精度和稳定性。它的性能比 MBQ 和 MQuant 等 VLM 感知基线高出高达 5.9%,并且比单一模态改进高出高达 8.6%。