论文

揭晓:用于多模式文档检索的统一视觉文本集成和 蒸馏

Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval

摘要

由于文档格式和模式的多样化,现实场景中的文档检索面临着巨大的挑战。传统的基于文本的方法依赖于定制的解析技术,忽略布局信息并且容易出错,而最近的免解析视觉方法通常难以在文本丰富的场景中捕获细粒度的文本语义。为了解决这些限制,我们提出了 \textbf{Unveil},这是一种新颖的视觉文本嵌入框架,可以有效地集成文本和视觉特征以实现稳健的文档表示。通过知识蒸馏,我们将语义理解能力从视觉文本嵌入模型转移到纯视觉模型,实现高效的免解析检索,同时保持语义保真度。实验结果表明,我们的视觉文本嵌入方法超越了现有方法,而 知识蒸馏 成功弥合了视觉文本和纯视觉方法之间的性能差距,提高了检索准确性和效率。