论文
视觉后期分块:高效视觉文档检索的上下文分块的实证研究
Visual Late Chunking: An Empirical Study of Contextual Chunking for Efficient Visual Document Retrieval
摘要
多向量模型由于其细粒度的匹配能力而在视觉文档检索(VDR)中占据主导地位,但其高存储和计算成本给实际部署带来了主要障碍。在本文中,我们提出了 ColChunk,这是一个即插即用的框架,它引入了多模式后期分块来构建高效的、上下文化的多向量。与现有的修剪或固定词元方法不同,ColChunk 在补丁级嵌入上采用分层聚类,并先与 2D 位置融合以确保空间语义一致性。这种自适应分组允许内容感知的表示,保留全局上下文,同时大大减少矢量计数。对 24 个 VDR 数据集的评估表明,ColChunk 实现了存储需求降低 90% 以上,同时在代表性单向量模型的 nDCG@5 中实现了 9 个点的平均改进。 ColChunk 为平衡视觉文档系统的检索准确性和效率提供了实用的解决方案。