论文
CompRank:通过 词元级 压缩和免解码评分进行高效的 LLM 重新排名
CompRank: Efficient LLM Reranking via Token-Level Compression and Decoding-Free Scoring
摘要
大语言模型 (LLM) 重排序器已成为现代检索和检索增强生成管道的重要组成部分,但其高计算成本限制了它们对长候选列表的适用性。在本文中,我们提出了 \textbf{CompRank},一种有效的词元重排序框架,通过将重排序器设计与排序信号的稀疏性相结合来减少冗余计算。 CompRank 将文档表示与候选顺序和查询上下文解耦,从而实现可重用的文档端状态;应用分段词元压缩来减少查询-文档交互成本;并引入了 CopyNet 式的目标,将基于注意力的文档评分与训练监督直接结合起来。在七个 BEIR 数据集上的实验表明,CompRank 实现了强大的重排序性能,同时仅保留 10.2% 的文档 token,平均 NDCG@10 为 39.2,而在全 token 注意力下为 39.7。 TREC-COVID 上的进一步扩展实验表明,在 30 个文档列表上进行训练后,在最多 500 个文档的候选列表上进行评估时,CompRank 保持稳定,同时比基于生成的列表重新排序实现 $4.9\times$--$9.5\times$ 端到端加速,比全词元 CompRank 变体实现约 $1.3\times$ 加速。这些结果表明,词元级 压缩和免解码注意力评分为可扩展的基于 LLM 的重新排名提供了有效的途径。