论文

用于高效且经济高效的检索增强生成系统的 Web 检索感知分块 (W-RAC)

Web Retrieval-Aware Chunking (W-RAC) for Efficient and Cost-Effective Retrieval-Augmented Generation Systems

上下文与知识检索增强

摘要

检索增强生成 (RAG) 系统严重依赖有效的文档分块策略来平衡检索质量、延迟和运营成本。传统的分块方法,例如固定大小、基于规则或完全代理的分块,通常会遇到词元消耗高、文本生成冗余、可扩展性有限和可调试性差的问题,特别是对于大规模 Web 内容摄取而言。在本文中,我们提出了 Web 检索感知分块(W-RAC),这是一种专为基于 Web 的文档设计的新型、经济高效的分块框架。 W-RAC 通过将解析的 Web 内容表示为结构化、ID 可寻址单元,并仅利用 大语言模型 (LLM) 进行检索感知分组决策而不是文本生成,将文本提取与语义块规划分离。这显着减少了词元使用,消除了幻觉风险,并提高了系统可观测性。实验分析和架构比较表明,W-RAC 实现了与传统分块方法相当或更好的检索性能,同时将与分块相关的 LLM 成本降低了一个数量级。