论文
选择重要的内容:用于长上下文嵌入的语义压缩引导选择性池化
Selecting What Matters: Semantic Compression-Guided Selective Pooling for Long-Context Embeddings
摘要
大语言模型(LLM)已显示出作为长上下文嵌入的免训练文本编码器的强大潜力。现有方法主要改善因果注意力下的信息流,并且通常通过均匀平均所有词元表示来构建嵌入。然而,对于长文档,这种均值池可能会用大量冗余或信息量较弱的内容来稀释显着的语义信息。为此,我们提出了 SCSP,这是一种免训练框架,利用语义压缩在长上下文嵌入中进行信息标记选择。具体来说,SCSP 首先将文档划分为句子感知块,并向每个块附加语义压缩提示。提示隔离的注意掩码保留了文档标记之间的信息流,同时将每个提示限制在其相应的本地上下文中。然后,我们使用这些提示引发的注意模式来估计词元重要性,选择信息丰富的词元,并将其中间层表示聚合到最终的嵌入中。对长上下文嵌入基准的大量实验表明,SCSP 可以以即插即用的方式集成到零样本和微调模型中,从而持续提高其性能。