论文

用于混合检索的参数化密集-稀疏融合:使用 Qdrant 调整 BEIR SciFact 上的排名分数混合

Parameterized Dense-Sparse Fusion for Hybrid Retrieval: Tuning a Rank-Score Mix on BEIR SciFact with Qdrant

摘要

我们研究了一种参数化混合排序器,它融合了密集的嵌入列表和稀疏的词汇列表。该方法有一个小的、显式的参数向量:密集先验 $\alpha \in [0,1]$、分数与排名混合 $\lambda \in [0,1]$、RRF 平滑参数 $\kappa > 0$、每个查询移动 $\alpha$ 的可选列表几何系数,以及可以关闭稀疏搜索的路由器余量 $\tau$。我们在 SciFact 训练(809 个查询)上对这些范围进行网格搜索,并在 SciFact 测试(300)上冻结所选值。调整后的排名分数组合($\alpha = 0.8$,$\lambda = 0.75$,$\kappa = 20$)达到 0.753 nDCG@10 和 0.889 recall@10,在该测试分割上优于密集 BGE(0.742 / 0.871)和等权重 RRF(0.707 nDCG@10)。列表条件 $\alpha$ 添加 +0.0006 nDCG;稀疏路由器被同一个列车分割拒绝(任何跳过大约 50% 查询的 $\tau$ 丢失了 nDCG)。这些系数是特定于数据集的。具有相同模型的相同 RRF 在九个 zip BEIR 宏观平均值上无法击败密集型(0.479 vs. 0.519 nDCG@10)。在所有 20 个索引单元上独立重复相同的训练然后冻结扫描,在 20/20 上击败相等的 RRF,在 16/20 上击败密集的(单元均值 nDCG@10 0.467 vs. 0.462 密集 vs. 0.420 RRF)。其他语料库应该重用范围,而不是 SciFact 点的副本。