论文
MERGE:通过生成丰富进行检索的多大语言模型集成
MERGE: Multi-LLM Ensemble for Retrieval via Generative Enrichment
摘要
大语言模型 (LLM) 越来越多地用于丰富信息检索 (IR) 中的用户查询,以便 BM25 等标准检索器可以弥补目标语料库的词汇差距。然而,任何单一的大语言模型都受到其训练数据和架构偏差的限制,其丰富行为取决于手工制作的提示,这些提示必须为每个新模型重新设计——这是一个昂贵且可扩展性差的过程。我们提出了 MERGE(通过生成丰富进行检索的多 LLM 集成),这是一个两阶段框架:三个异构 7-8B 开源 LLM 独立生成候选扩展,而一个更大的 LLM 将它们生成地合成为单个查询。为了使提示工程在整个整体中可扩展,我们将基于任务的自动提示优化(APO)循环集成到两个阶段中。与使用 LLM 评估器判断候选者的 APO 方法不同,我们的循环根据每个候选者的下游检索性能对每个候选者进行评分,并在当前冠军提示和优化器建议的草稿之间运行小型锦标赛,一旦冠军连续两轮生存下来,则终止;历史增强的变体还可以将最近的锦标赛轨迹反馈给优化器。 MERGE 与检索器无关,并且发出单个 BM25 传递,没有等级融合、没有监督文档扩展、也没有重新索引。在五个 BEIR 基准(NQ、SciFact、FiQA、Touche-2020、DBPedia)上,MERGE 将 BM25 nDCG@10 比原始查询提高了 +2.1 至 +14.9 点,并且尽管仅使用紧凑的开源模型,但仍匹配或优于基于 LLM 的强大查询扩展基线。消融证实,第 2 阶段集成击败了任何单个第 1 阶段 LLM,并且基于任务的 APO 将大型种子提示回归转换为一致的增益,而无需手动调整。