论文
Giga-Embeddings:用于高吞吐量文本嵌入的专家混合编码器
Giga-Embeddings: Mixture-of-Experts Encoders for High-Throughput Text Embeddings
摘要
我们引入了 Giga-Embeddings,这是一系列文本嵌入模型,旨在将强大的检索质量与高效的服务结合起来。它最大的成员是一个稀疏的 10B 参数 Mixture-of-Experts 编码器,每个词元大约有 1.8B 活动参数。在英语、俄语、多语言和代码 MTEB 基准测试中,该模型在所有四个评估套件中实现了系列中最强的总体性能。在我们具有 1024 个词元输入的 vLLM 基准测试中,它每秒处理 114.5k 个词元,吞吐量比密集 3B 模型高 25%,是评估的外部系统吞吐量的 1.56-2.65 倍。该系列还包括一个密集的 3B 编码器和一个精炼的 480M 编码器,以实现更严格的计算和内存预算。我们使用与维度无关的目标来训练紧凑模型,该目标对齐教师和学生的相似性分布。由此产生的 480M 模型在俄罗斯 MTEB 上的得分为 70.98,超过了 FRIDA,同时使用的参数少了 42%。我们发布了所有三个模型检查点。