论文
STAIR(结构感知信息检索器):用于文档结构增强的新数据集与大语言模型检索器
STAIR (STructure Aware Information Retriever): A novel dataset and LLM based retriever for document structure augmentation
摘要
检索增强生成 (RAG) 是使用大语言模型 (LLM) 生成准确且无幻觉答案的关键组件。LLM在处理长上下文方面正在进步,但仍然遭受“迷失在中间”的问题。因此,精确、准确的检索非常重要。当前的检索器将长上下文分成基于长度的可管理块 - 在此过程中丢弃语料库中丰富且信息丰富的语义全局结构。我们引入了一种新颖的检索系统 STAIR,它使LLM能够利用语料库中的全局结构(例如目录(ToC))来有效地存储和检索其模型参数中的信息。我们使用微调的可微搜索索引 (DSI) 系统进行的彻底、仔细的消融研究表明,ToC 有助于构建低幻觉(低于 0.05%)的生成信息检索 (IR) 系统,并且可以推广到可用训练样本很少的示例。为了进一步研究这个基于 ToC 的检索的新方向,我们发布了 SearchTome——一个由 6 个不同领域的 18 本书创建的多样化基准,以进一步研究这个新方向。 STAIR 在 SearchTome 上获得了 82.6% 的高 Recall@1 分数,而 DSI (76.9%) 的差异具有统计显着性。 STAIR 轻松击败了其他强大的基线,例如 BM25 (59.5%)、DPR (68.7%) 和开箱即用的 Mistral (13.8%)。