论文
AnchorFold:通过递归注意力传播实现高效多向量视觉文档检索的焦点然后折叠框架
AnchorFold: A Focus-Then-Fold Framework via Recursive Attention Propagation for Efficient Multi-Vector Visual Document Retrieval
摘要
多向量视觉语言 检索器 通过后期交互实现细粒度的视觉文档检索 (VDR),但每页存储和评分数百个视觉补丁嵌入会产生大量开销。现有的 无需训练 方法依赖于修剪或合并:修剪在积极压缩下急剧退化,而合并在形成代表时并没有明确优先考虑重要区域。我们介绍 AnchorFold,一个用于文档端索引压缩的 无需训练 focus-then-fold 框架。 AnchorFold 在视觉自注意力图上应用递归注意力传播,在每个注意力头内执行多步传播,并整合跨头和层的分数。焦点阶段选择中心度最高的词元作为锚点。折叠阶段将剩余标记分配给归一化检索空间中最相似的锚点,并通过中心性加权聚合总结每个以锚点为中心的组。这保留了非锚定贡献,同时将容量集中在结构上重要的词元上。在具有三种不同检索主干的 ViDoRe v1/v2 和 REAL-MM-RAG 中,AnchorFold 始终优于所有评估的 无需训练 基线,$γ\leq 为 0.20$。在 ViDoRe v1/v2 上,它在 $5\times$ 压缩下平均保留了 98.3% 的全索引 NDCG@5,实现了近乎无损的压缩,在 $20\times$ 压缩下保留了 92.4%。