论文

KaLM-Reranker-V1:压缩文档重新排序的快速但不延迟的交互

KaLM-Reranker-V1: Fast but Not Late Interaction for Compressed Document Reranking

上下文与知识检索增强

摘要

随着检索系统规模的扩大,有效且高效的重新排序变得越来越重要。然而,大多数现有的基于编码器和解码器的重新排序器联合处理每个查询-段落对,紧密耦合它们的在线计算并限制部署效率和灵活性。我们提出了 KaLM-Reranker-V1,一种快速但非后期交互的 FBNL 重排序器,它可以解耦查询和段落计算,同时保留表达相关性建模。 KaLM-Reranker-V1 基于编码器-解码器架构构建,使用 Matryoshka 嵌入池对段落进行预编码,而其解码器则对系统和用户指令以及查询意图进行建模;然后,交叉注意力捕获结果查询上下文和段落表示之间的细粒度相关性。这些设计共同提供了四个关键优势:(i) 离线通道编码的效率,(ii) 交叉注意力的表现力,(iii) Matryoshka 嵌入池的紧凑性,以及 (iv) 通过可调整的计算预算进行测试时计算。我们实例化了三种尺寸的 KaLM-Reranker-V1:Nano、Small 和 Large,激活参数分别为 0.27B、1B 和 4B。 BEIR、MIRACL 和 LMEB 上的大量实验证明了强大的重排序性能和卓越的效率。在 BEIR 和 MIRACL 上,我们的模型在多领域和多语言重排序方面取得了具有竞争力的性能,与 Qwen3/BGE-Reranker 系列等强大的工业重排序器相当。在 LMEB-Dialogue 上,紧凑的嵌入模型与我们的 Nano reranker 配合使用,其激活参数只有 0.27B,与 7--12B 嵌入模型相比仍然具有竞争力。数据和模型可在 https://huggingface.co/collections/KaLM-Embedding/lychee-kalm-reranker-and-jev 获取。