论文

AutoIndex:学习检索表示程序

AutoIndex: Learning Representation Programs for Retrieval

摘要

我们提出了 AutoIndex,一个用于学习表示程序的框架:将原始文档映射到公开给检索系统的表示的可执行转换。 AutoIndex 不是调整 检索器、重新排序器或一小组预处理超参数,而是在索引之前搜索对文档进行切片、丰富、规范化、重新加权或重新组织的程序。在每次迭代中,AutoIndex 都会执行验证引导的程序搜索,其中代理诊断当前程序的故障并综合候选更新,仅保留在结果索引下提高检索质量的更新。我们在 CRUMB(异构检索任务的基准)上评估 AutoIndex,并在所有实验中保持固定的 BM25。学习程序在所有 8 项任务上均提高了静态全文档 BM25 基线的召回率,Recall@100 中的平均增益为 +8.4%,nDCG@10 中的平均增益为 +8.3%,Recall@100 中的最大增益为 +30.5%,nDCG@10 中的最大增益为 +43.6%。这些结果表明,文档表示不应被视为检索开始之前做出的固定预处理选择,而应被视为明确的优化目标。重现结果的代码可在 https://github.com/auto-index/autoindex 上找到。