论文
AdaMerge:用于多向量视觉文档检索的免调整补丁压缩
AdaMerge: Tuning-Free Patch Compression for Multi-Vector Visual Document Retrieval
摘要
ColPali 和 ColNomic 等多向量视觉文档检索 (VDR) 模型通过使用数百到数千个补丁级嵌入来表示每个文档,从而实现了极高的准确性,但存储成本和延迟成本却很高。现有的压缩方法要么修剪不重要的补丁,要么将相似的补丁合并到簇中;最近最先进的合并方法 Prune-then-Merge (PtM) 在高压缩下始终优于仅修剪基线,但需要通过网格搜索调整每个数据集集群预算 m。我们观察到,分层聚类产生的合并余弦序列表现出一个尖锐的悬崖,将可合并冗余与显着信号分开,并且该悬崖的位置集中在来自 14 个数据集的 11,000 多个文档的窄带中。这表明可以按文档检测合并边界,而不是按数据集调整合并边界。基于这一观察,我们提出了 AdaMerge,这是一种即插即用的压缩方法,该方法(i)通过合并余弦轨迹上的间隙分析来检测每个文档自己的悬崖,以及(ii)构建注意力加权聚类质心以保留显着信号。在长文档基准 ViDoRe-V2(4 个数据集,两个主干)上,AdaMerge 在整个操作范围内显着优于经过调整的 PtM (p < 10^-4);在短文档基准 ViDoRe-V1(10 个数据集,两个主干)上,所有合并方法都已经接近无损,AdaMerge 可以匹配经过调整的 PtM,而无需对每个数据集进行任何调整。 AdaMerge 每个文档仅增加约 10 毫秒,并公开跨所有数据集和主干共享的单个全局超参数。