论文
DoPR:可重复使用的压缩文档前缀,可实现高效的 LLM 重新排名
DoPR: Reusable Compressed Document Prefixes for Efficient LLM Reranking
摘要
大语言模型 (LLM) 是有效的重新排序器,但逐点重新排序在不同查询中重复处理同一文档,导致大量冗余的文档端计算。我们提出了 \textbf{DoPR},一个压缩文档前缀框架,它将离线文档处理与在线重新排名分离。 DoPR 首先选择与查询无关的文档表示并将其转换为压缩文档前缀状态,这些状态会在离线状态下预先计算并在检索文档时重复使用。在在线重新排名期间,模型通过仅处理查询和评分标记来对每个查询-文档对进行评分,文档信息由存储的前缀状态提供。这种设计通过文档端压缩和跨查询前缀状态重用来降低在线成本。使用从 $0.6$B 到 $8$B 的 Qwen3 模型对 TREC DL、BEIR 和 BRIGHT 进行的实验表明,DoPR 实现了高达 8.0$\times$ 的在线文档端内存减少和高达 8.04$\times$ 的延迟加速,同时保留了匹配的全文档重新排序器的平均 NDCG@10 的 \textbf{97.1\%-99.5\%}。