论文

ConCise:无需训练 结论链状态压缩,用于经济高效的多步 RAG 服务

ConCise: Training-Free Conclusion-Chain State Compression for Cost-Efficient Multi-Step RAG Services

上下文与知识上下文工程

摘要

多步检索增强生成 (RAG) 已被广泛部署为 LLM 支持的 Web 服务,用于复杂的问题解答,其中迭代检索推理轮次可提供强大的多跳准确性。然而,这种范式会导致历史文档和推理痕迹在各轮中累积,使累积输入词元膨胀大约为 $O(N^2)$,并且噪声密度逐渐增加。在基于 API 的服务架构中,这种增长直接放大了每个请求的计费成本、网络负载和响应延迟。现有的压缩方法依赖于预训练的模块或 GPU 级 KV 缓存访问,从而引入与 API 原生、无服务器和边缘部署不兼容的模型托管开销。为了解决这个问题,本文提出了 ConCise,一种 无需训练 状态层协议,它重构了多步 RAG 服务的跨轮上下文传输。具体来说,ConCise 用仅附加的结构化结论链取代了原始文本累积,将累积上下文增长从 $O(N^2)$ 压缩到大约 $O(N)$。此外,引入了融合生成机制,在单个 API 调用中联合发出推理和结论,消除了串行双调用开销中的重复输入计费。涵盖三个模型、两个数据集和两个代表性框架的十二对配置的广泛实验表明,ConCise 平均节省了 64.63% 的词元,同时保持可接受的准确性,为经济高效的多步骤 RAG 服务优化提供了即插即用、部署友好的解决方案。