论文
超越未压缩的压缩:RAG 中软上下文压缩的两阶段训练方法
Compression Beyond the Uncompressed: A Two-Stage Training Recipe for Soft Context Compression in RAG
摘要
检索增强生成(RAG)利用外部知识增强了语言模型,但冗长的检索上下文会导致输入膨胀并降低推理效率。软上下文压缩将每个文档编码为更短的嵌入序列。然而,大多数现有方法都是通过从未压缩的 RAG 系统中提取输出来进行训练的,这本质上限制了它们相对于原始模型的性能。为了解决这个限制,我们提出了 DEX-Comp,一个两阶段的训练方案:纯 蒸馏 仅在未压缩 RAG 的正确响应上热启动压缩模型,然后硬探索仅在未压缩 RAG 失败的查询上运行强化学习,迫使模型探索更适合压缩表示的计算模式。在检索深度从前 5 到前 30 的五个开放域 QA 基准上,DEX-Comp 将检索到的上下文压缩了 16\times$,并将推理加速了 $4\times$--$24\times$,同时在检索深度上实现了与未压缩 RAG 基线相当或超过的性能。跨不同数据集和主干的消融和评估进一步证实了每个阶段的贡献和我们方法的泛化。