XFP:针对 LLM 推理的具有稀疏离群值分离的质量目标自适应码本量化
XFP: Quality-Targeted Adaptive Codebook Quantization with Sparse Outlier Separation for LLM Inference
摘要
我们引入了 XFP,一种用于 LLM 推理的动态权重量化器,它反转了传统的工作流程:操作员指定每个通道余弦相似性的重建质量楼层(一个用于注意力和共享专家的严格楼层,一个用于路由专家 MoE 的惰性楼层); XFP 自动确定码本大小、离群值预算和每层打包——无需 Hessian、无需校准数据、无需手动选择位宽。每个权重矩阵被分解为稀疏的 fp16 离群残差和密集的子字节索引张量,并分解为每组学习的码本。两种存储模式共享一个自动选择前端和一个融合解码内核:V2(每通道 Lloyd)和 V2a(每层 L=32 个码本的共享库)。在 V2 下的 Qwen3.5-122B-A10B 上,XFP 在工作站硬件(RTX PRO 6000 Blackwell,TP=2)上以 94.49% GSM8K 严格匹配(3 个种子,n=3957)达到 138 tok/s 单流解码,并且在 TP=1 时比 Marlin INT4 快 49%。对于不适合目标内存包络的模型,我们提出了 H 过程:对两个余弦阈值进行质量驱动的迭代,找到模型恰好适合的操作点,同时仍产生合理的输出。三个约束定义了其搜索空间:操作员设置的阈值、加载量化时的 OOM 边界以及生成中的垃圾边界(余弦相似性引导;工作台验证)。在 Qwen3.5-397B-A17B(512 个路由专家/层)上,H-Process 以约 3.4 个有效位将完整的专家群体装入 2x96 GB,并在完整的 1319 问题集上以 66.72% GSM8K 严格匹配的速度提供 100.9 tok/s 的长输出解码(提交时的单种子;正在进行的多种子评估),超过了 INT4同时对内存、吞吐量和准确性进行路由专家修剪。