论文
快速而忠实:长文档检索增强生成系统的实时验证
Fast and Faithful: Real-Time Verification for Long-Document Retrieval-Augmented Generation Systems
摘要
检索增强生成 (RAG) 越来越多地部署在企业搜索和以文档为中心的助手中,其中响应必须基于冗长而复杂的源材料。在实践中,验证生成的答案是否忠实地反映检索到的文档是很困难的:大语言模型 可以检查长上下文,但对于交互式服务来说速度太慢且成本高昂,而轻量级分类器在严格的上下文限制内运行,并且经常会丢失被截断的段落之外的证据。我们提出了集成到生产 RAG 管道中的实时验证组件的设计,该组件可在延迟限制下实现完整文档证据核验。该系统可处理多达 32K 个词元的文档,并采用自适应推理策略来平衡跨工作负载的响应时间和验证覆盖范围。我们描述了用于部署验证器的架构决策、操作权衡和评估方法,并表明与截断验证相比,全上下文验证大大改进了对不受支持的响应的检测。我们的经验强调了何时需要长上下文验证、为什么基于块的检查在真实文档中经常失败,以及延迟预算如何影响模型设计。这些发现为从业者构建可靠的大规模检索增强应用程序提供了实用指导。 (模型、基准和代码:https://huggingface.co/LLM-semantic-router)