论文

静态嵌入能为混合荷兰语检索增加价值吗?

Do Static Embeddings Add Value to Hybrid Dutch Retrieval?

模型评测模型能力评测

摘要

嵌入基准衡量独立模型的质量,但它们并不能确定一旦词汇检索和基于 Transformer 的检索结合起来,低成本的 检索器 是否会提供互补的排名信息。我们通过荷兰语大规模文本嵌入基准 (MTEB-NL) 的荷兰语检索任务对这个问题进行了受控评估。加权倒数排名融合 (RRF) 结合了最佳匹配 25 (BM25)、Qwen/Qwen3-Embedding-0.6B (Qwen) 和两个多语言静态嵌入模型。对包含 14,500 个查询和 786,573 个文档的五个数据集进行了详尽的评分,并在单纯形上以 0.1 的增量搜索融合权重。十倍查询级交叉验证选择九个折叠上的权重,并在保留的折叠上对其进行评估;配对的引导置信区间和符号随机化测试量化了所得的差异。 Fusion 比训练选择的个体 检索器 的平均倒数排名 (MRR) 在 Dutch News 上提高了 0.061,在 VABB 上提高了 0.029,在 WebFAQ NL 上提高了 0.004,在 Wikipedia NL 上提高了 0.025,同时在 Open Tender 上与 BM25 相匹配。经过霍尔姆校正后,所有四个正差异仍然可以与零区分开。没有不受限制的折叠为任一静态 检索器 分配正权重:所有 50 个选择都位于 BM25-Qwen 边缘,并且强制静态贡献会降低有效性。留一数据集选择在每次迭代中选择相等的 BM25-Qwen 权重,并且在每个保留任务上优于跨域选择的个体 检索器。结果支持两个 检索器 词汇 Transformer 架构作为评估的荷兰语任务中稳健的测试默认值,并表明独立基准性能不足以在混合检索中建立边际价值。