论文
CoinRAG:长上下文 RAG 的上下文信息块 KV 缓存重用
CoinRAG: Contextualized Information Nugget KV Cache Reuse for Long-Context RAG
摘要
已有检索增强生成优化方法复用文档片段级KV缓存以降低长上下文处理成本,但粗粒度片段仍含大量冗余与噪声。CoinRAG采用面向长上下文RAG的上下文化信息单元KV缓存复用,在低预填充延迟约束下改善成本与准确性的帕累托前沿。其名称借用小“硬币”组合积累价值的比喻:系统组合复用离线计算的细粒度信息单元缓存,以紧凑且语义相关的方式构建上下文。具体而言,它不编码完整文档片段,而以两阶段检索找出其中与查询相关的语义单元,再将这些单元的KV切片与片段级上下文组合。在LongBench多跳问答任务上,CoinRAG显著降低运行成本,在标准快速预填充延迟预算下,答案质量F1平均相对提高5.3%,形成优于所比较基线的新帕累托前沿。