论文
用于高效文档重新排序的分层词元压缩
Layer-wise Token Compression for Efficient Document Reranking
摘要
基于 Transformer 的文档交叉编码器重排序器是现代信息检索系统的核心组件。尽管取得了成功,但由于在推理时处理较长的查询文档序列,这些模型的计算成本很高。提高效率的一种已知方法是词元压缩,其包括在初始嵌入层中将词元组聚合在一起,减少词元的有效数量,并使计算速度更快。虽然词元压缩已被证明对于双编码器 检索器 是成功的,但我们根据经验观察到这种方法对于跨编码器重新排序可能无效。在本文中,我们提出了逐层词元压缩(LTC),它在中间 Transformer 层应用自适应词元池。通过对 MS MARCO 段落和文档排序任务的广泛消融研究,我们证明中间层的压缩可以保持排序质量,同时将段落排序的推理 QPS 提高高达 25%,将文档排序的推理 QPS 提高高达 116%。我们还将 LTC 扩展到列表 LLM 重新排序,并表明相同的方法可以轻松应用于长上下文列表重新排序,其中 QPS 改进甚至更大。更令人惊讶的是,当将短段落训练的重排序器应用于长文档排序任务时,经过压缩训练的模型优于未压缩的模型,这表明压缩可能充当有益的正则化器,鼓励长度不变的表示。