论文
您的非嵌入矩阵是文本嵌入的秘密功能镜头
Your UnEmbedding Matrix is Secretly a Feature Lens for Text Embeddings
摘要
大语言模型 在各种下游任务中表现出令人印象深刻的零样本能力。然而,它们很难作为现成的嵌入模型发挥作用,导致在大规模文本嵌入基准测试中表现不佳。在本文中,我们确定了造成这一缺陷的潜在原因。我们的动机源于一个意想不到的观察:当投影到词汇空间时,文本嵌入往往与频繁但无信息的标记保持一致。我们认为,这种高频标记的过度表达抑制了模型捕获细微语义的能力。为了解决这个问题,我们引入了 EmbedFilter,这是一种简单的线性变换,旨在细化直接从 LLM 派生的文本嵌入。具体来说,我们发现 LLM 中的非嵌入矩阵编码了一个潜在空间,该空间正在主动将这些频繁标记写入嵌入空间。通过过滤掉这个子空间,EmbedFilter 抑制了高频标记的影响,从而增强了语义表示。作为一个引人注目的副产品,这可以实现固有的降维,减少索引存储并加速检索,同时完全保留精致的嵌入质量。我们在多个 LLM 主干上进行的实验表明,配备 EmbedFilter 的 LLM 即使在嵌入尺寸显着减小的情况下也能实现卓越的零样本下游性能。我们希望我们的研究结果能够更深入地了解基于 LLM 的表示机制,并激发更有原则的设计来改进文本嵌入训练。我们的代码可在 https://github.com/CentreChen/EmbFilter 获取。