论文

嵌入者的困境:LLM 更好,但代价是什么?

The Embedder's Dilemma: LLMs Are Better, but at What Cost?

模型评测模型能力评测

摘要

您是否应该用 大语言模型 替换文本嵌入管道?我们通过对 6 个系列的 10 个 LLM 和 26 个嵌入模型(118M 到 14B 参数)在分类、语义文本相似性 (STS)、聚类、对分类和检索等 37 个任务上进行受控、成本感知的比较来回答这个问题。总的来说,这两个范式有效地联系在一起:最佳 LLM(Gemini 3.1 Pro,77.6)和最佳嵌入模型(77.2)相差 0.4 个点。它们的优势因任务而异:LLM 领先于推理型检索,嵌入模型领先于分类,两者在聚类、STS 和配对分类上相匹配。达到这种平等的代价是昂贵的。 LLM 的成本比同等质量的嵌入模型高出 1,431 倍(每次基准测试通过 154 美元 vs 0.11 美元),而开放式 LLM 测试的进程词元在相同 GPU 上的速度要慢 2.5 至 736 倍。推理词元占 LLM 推理成本的 28% 至 81%;较低的推理预算可以保持或提高我们消融中大多数模型的检索质量。 Pareto 前沿包含领先的嵌入模型和一个 LLM,Gemini 3.1 Pro。这些结果支持分工:使用嵌入模型进行相似性、分类和聚类,并保留 LLM 用于推理密集型检索。我们的代码、数据集和结果可在 https://github.com/embeddings-benchmark/embedders-dilemma 上公开获取。