论文

HaS:通过同源感知推测检索加速 RAG

HaS: Accelerating RAG through Homology-Aware Speculative Retrieval

上下文与知识检索增强

摘要

检索增强生成 (RAG) 通过检索外部文档作为上下文,扩展了 大语言模型 (LLM) 推理时的知识边界。然而,随着知识数据库规模的增大,检索变得越来越耗时。现有的加速策略要么通过近似检索来损害准确性,要么通过重用完全相同的查询结果来实现边际收益。我们提出了 HaS,一种同源感知推测检索框架,它在有限范围内执行低延迟推测检索以获得候选文档,然后验证它们是否包含所需的知识。基于查询之间的同源关系的验证被制定为同源查询重新识别任务:一旦先前观察到的查询被识别为传入查询的同源重新遇到,则草稿被认为是可接受的,从而允许系统绕过缓慢的全数据库检索。受益于现实世界流行模式下同源查询的流行,HaS 实现了显着的效率提升。大量实验表明,HaS 将数据集的检索延迟减少了 23.74% 和 36.99%,而边际准确率仅下降 1-2%。作为即插即用的解决方案,HaS 还可以显着加速现代代理 RAG 管道中的复杂多跳查询。源代码位于:https://github.com/ErrEqualsNil/HaS。