论文
训练后量化破坏文本嵌入器的地方:四个嵌入器系列的测量图
Where Post-Training Quantization Breaks Text Embedders: A Measured Map Across Four Embedder Families
摘要
仅权重训练后量化是缩小检索嵌入器的最便宜的方法,并且收到的应用建议(保护嵌入表、按模块灵敏度分配位、优先考虑排名感知目标而不是权重重建)已基本完整地引入 LLM 量化中。我们直接在检索嵌入器上测试该建议,跨位宽和组大小的网格量化来自四个架构系列的五个检查点,并隔离每个宽度的嵌入、注意力和前馈块。每个启发式方法都无法按照规定进行转移。尽管嵌入表是其中几个系列中最大的张量,但嵌入表从未成为任何系列中占主导地位的隔离保护优先级。模块敏感性不能作为可转移的排序而存在:在 INT4/g16 中,模块之间的差异太小而无法分配;在 INT3 中,排序变得依赖于族,并且关节损伤不再是其各部分的总和;在 INT2 中,可比较的重建误差伴随着从 1.3% 到 65.9% 的全精度的保留。廉价的重建代理对于筛选统一的位宽度很有用,但对于选择要保护的张量来说不太可靠;它在整个网格上的明显强度是范围扩展的产物。 INT3 的一名经过蒸馏的 1.09 亿学生在 68.4 MB 中拥有 78.04 NDCG@10,并且在大小和质量上都领先于其自己的 0.6B 教师的极端 PTQ 臂(297.9 MB 在 64.46)——但仅限于其被蒸馏的任务。大小是现有文件的字节数,而不是算术估计值,测量存储库携带每个文件的字节来源。