论文
FGR-ColBERT:在检索过程中识别细粒度的相关性标记
FGR-ColBERT: Identifying Fine-Grained Relevance Tokens During Retrieval
摘要
文档检索识别相关文档,但不提供细粒度的证据线索,例如特定的相关跨度。一个可能的解决方案是在检索后应用 LLM;然而,这会带来大量的计算开销并限制实际部署。我们提出了 FGR-ColBERT,它是 ColBERT 检索模型的修改版,它将从 LLM 中提取的细粒度相关信号直接集成到检索函数中。 MS MARCO 上的实验表明,FGR-ColBERT (110M) 的 词元级 F1 为 64.5,超过了 Gemma 2 (27B) 的 62.8,尽管其尺寸小了大约 245 倍。同时,它保留了检索有效性(相对 Recall@50 为 99%)并保持高效,与原始 ColBERT 相比,仅产生约 1.12 倍的延迟开销。