论文

什么时候 0.1% 就足够了?分析降维和量化对文本嵌入压缩的综合影响

When Is 0.1% Enough? Analyzing the Combined Effects of Dimensionality Reduction and Quantization on Text Embedding Compression

模型优化模型压缩

摘要

最近的高性能文本嵌入模型通常输出高维实值向量,导致大量的存储和计算成本。为了解决这个问题,人们提出了基于降维或量化的压缩方法;然而,降维和量化相结合的效果尚未得到充分研究。在本文中,我们使用四个 MTEB 任务族和四个预训练的嵌入模型,通过结合降维和量化来系统地检查压缩文本嵌入的有效性。实验结果表明,结合降维和量化可以比单独使用任一方法实现更强的压缩,在某些设置中嵌入可以减少到原始大小的 0.1%,几乎不会降低性能,并且最佳压缩策略取决于任务。