论文

用于检索增强生成的预测预取

Predictive Prefetching for Retrieval-Augmented Generation

模型推理推理加速

摘要

检索增强生成 (RAG) 改善了 大语言模型 中的事实基础,但由于同步检索而存在大量延迟。虽然最近的工作探索了异步检索,但现有方法依赖于检索和生成之间的启发式协调,并假设解码过程中的稳定信息需求,而这些需求通常会在复杂的多域设置中中断。在本文中,我们提出了一种先进的异步检索框架,该框架能够根据不断变化的信息需求进行预测预取。该框架通过利用生成动态中的语义前兆(在不确定性变得至关重要之前出现多个标记),使用三个组件(检索预测器、上下文监视器和查询生成器)明确预测何时应触发检索以及应检索哪些信息。多个基准测试表明,端到端延迟降低高达 43.5%,首次词元时间提高 62.4%,同时保持与同步 RAG 基准相当的答案质量。