论文

RAGOCR:通过视觉表示对检索增强文本进行光学压缩

RAGOCR: Optical Compression of Retrieval-Augmented Text via Visual Representation

上下文与知识上下文工程

摘要

检索增强生成 (RAG) 已成为知识密集型问答的关键,但由于处理冗长的检索上下文的计算成本过高,扩展 RAG 管道仍然具有挑战性。现有的压缩方法面临着一个基本的权衡:硬压缩方法以查询感知的方式在线运行,但只能实现适度的压缩率,并且通常需要 微调 生成模型,而软压缩方法可以获得更高的比率,但依赖于成本高昂的离线编码,而离线编码与输入查询完全无关。为了弥补这一差距,我们引入了 RAGOCR,这是一种新颖的框架,可以根据输入查询将检索到的文档压缩为紧凑的视觉表示。为了进一步平衡压缩率和信息保真度,我们引入了一种查询感知的动态分辨率机制,该机制根据每个文档的估计相关性和复杂性自适应地分配视觉粒度:高度相关的段落以较高分辨率呈现,以保留细粒度的细节,而外围文档以较低分辨率进行积极压缩。使用 MedOmniKB 检索语料库对五个 QA 基准进行的实验表明,RAGOCR 的准确度超过 naive RAG 超过 15%,同时只需要八分之一的输入标记数量,并且在不同的检索深度上始终优于硬压缩和软压缩基线。