论文

生成的查询扩展仍然有助于强大的稀疏检索:SPLADE-v3 的对照研究

Generated Query Expansion Still Helps Strong Sparse Retrieval: A Controlled Study with SPLADE-v3

上下文与知识检索增强

摘要

科学查询通常很简短,而相关论文则使用专门的词汇。生成的查询扩展可以弥补这种不匹配,但早期的工作表明,随着底层检索器变得更强,它的价值会缩小。我们在 NFCorpus、TREC-COVID 和 SciDocs 上使用 SPLADE-v3 测试术语列表、伪文档、多个伪引用和语料库引导文本的四种生成格式。每个条件都搜索相同的冻结文档索引,并遵循相同的查询端集成规则和256维预算,隔离添加内容的影响。所有 12 种方法-集合比较均提高了总体 nDCG@10,最佳相对增益为 4.81%、8.92% 和 9.47%。经过 Holm 修正后,有 11 个仍然显着。在 114 个插值设置中的 103 个中,增益持续存在,包括将至少 30% 的混合权重分配给原始查询的每个设置。在所有 24 项聚合比较中,打乱的文本和非上下文词汇袋控件也保持在基线之上,这表明增加的词汇带来了大部分好处。相比之下,语料库引发的类型化概念图不会产生一致的增益,并且其关系、深度、验证、随机和门控控制也无法挽救它。因此,只要原始查询保持强表示,生成的词汇表就可以补充强大的学习稀疏检索器。