论文

预算受限的在​​线检索增强生成:块即服务模型

Budget-Constrained Online Retrieval-Augmented Generation: The Chunk-as-a-Service Model

上下文与知识检索增强

摘要

大语言模型 (LLM) 彻底改变了自然语言处理领域。然而,它们表现出一些局限性,包括缺乏可靠性和透明度:它们可能产生幻觉并且无法提供支持生成输出的来源。 LLM 中引入检索增强生成 (RAG) 来解决此类限制。 RAG 即服务 (RaaS) 是一种流行的实施方式,其缺点阻碍了其采用和可访问性。例如,RaaS 定价基于提交的提示数量,而不考虑提示是否通过相关块(即从矢量数据库检索的文本段)或所使用块的质量(即它们的相关程度)来丰富。这导致支付模式不透明且成本效益较低。我们建议将块即服务 (CaaS) 作为一种透明且经济高效的替代方案。 CaaS 包括两种变体:开放预算 CaaS (OB-CaaS) 和有限预算 CaaS (LB-CaaS),后者由我们的“公用事业成本在线选择算法 (UCOSA)”启用。 UCOSA 通过基于预算限制和公用事业成本权衡以在线方式丰富所提交提示的子集,进一步扩展了 OB-CaaS 变体的成本效益和可访问性。我们的实验证明了所提出的 UCOSA 与离线和相关性贪婪选择基线相比的有效性。就性能指标而言(丰富提示的数量 (NEP) 乘以平均相关性 (AR)),UCOSA 的性能优于随机选择约 52%,达到离线选择方法约 75% 的性能。此外,在预算利用率方面,与RaaS相比,LB-CaaS和OB-CaaS的性能预算比分别达到140%和86%,效率更高。