论文

KoVRE:训练高效的韩语视觉文档检索嵌入模型

KoVRE: Training an Efficient Embedding Model for Korean Visual Document Retrieval

模型训练监督微调与指令调优

摘要

视觉文档检索(VDR)直接将文本查询与文档图像进行匹配,保留在文本提取过程中可能丢失的视觉和结构信息。然而,现有的VDR模型和训练资源主要集中在英语上,而许多高表现系统依赖于大规模的骨干网络或存储密集型的多向量表示。为了解决这些限制,我们引入了KoVRE:韩语视觉文档检索嵌入,这是一种针对韩语视觉文档的单向量检索器,同时提供了一个全面的训练配方。我们使用正负实例挖掘和控制训练数据组成、正负实例处理以及基于重排名的知识蒸馏,对708,729个韩语和英文查询-页面对进行训练。在韩语视觉文档检索基准测试中,我们的2B模型显著优于基础骨干模型,超越了其8B单向量版本,以及一个强大的多向量基准。这些结果表明,针对特定语言的监督和我们精心设计的训练策略可以生成在各种文档领域中高度有效的韩语VDR模型,而无需扩展骨干网络或多向量表示。