论文
大模型稠密检索器的泛化与稳定性系统分析
On the Robustness of LLM-Based Dense Retrievers: A Systematic Analysis of Generalizability and Stability
摘要
仅解码器 大语言模型 (LLM) 越来越多地取代 BERT 式架构,作为密集检索的骨干,实现了显着的性能提升和广泛采用。然而,这些基于 LLM 的 检索器 的稳健性仍未得到充分探索。在本文中,我们从两个互补的角度:泛化性和稳定性,对基于最先进的开源 LLM 的密集 检索器 的鲁棒性进行了首次系统研究。为了具有普遍性,我们评估了跨越 30 个数据集的四个基准的检索有效性,使用线性混合效应模型来估计边际平均性能,并将内在模型能力与数据集异质性分开。我们的分析表明,虽然指令调整的模型通常表现出色,但那些针对复杂推理进行优化的模型往往会遭受“专业化税”,在更广泛的背景下表现出有限的通用性。为了稳定性,我们评估模型针对无意查询变化(例如释义、拼写错误)和恶意对抗性攻击(例如语料库中毒)的弹性。我们发现,与仅编码器的基线相比,基于 LLM 的 检索器 显示出更高的针对拼写错误和语料库中毒的鲁棒性,但仍然容易受到同义词等语义扰动的影响。进一步的分析表明,嵌入几何形状(例如角度均匀性)为词汇稳定性提供了预测信号,并表明缩放模型大小通常可以提高鲁棒性。这些发现为未来稳健性感知的 检索器 设计和原则性基准测试提供了信息。我们的代码可在 https://github.com/liyongkang123/Robust_LLM_Retriever_Eval 上公开获取。