论文

KoViDoRe:韩国视觉文档检索

KoViDoRe: Korean Visual Document Retrieval

模型评测基准与评测资源

摘要

多模式检索的最新进展提高了从 PDF 和报告等视觉丰富的文档中检索信息的能力。然而,现有的基准仍然主要以英语为中心,对结构复杂的韩语视觉文档的覆盖范围有限。此外,大多数现有的韩国资源主要评估单页检索,未能捕获需要跨多个页面聚合证据的现实场景。为了解决这些差距,我们引入了 KoViDoRe,这是韩国视觉文档检索的基准。该数据集是根据公开的韩国文档构建的,具有多种布局,包括表格、图形和多列结构。我们开发了一个多阶段数据管理管道,包括结构化文档解析、使用基于摘要和基于上下文的策略生成综合查询,以及通过人工验证进行相关性映射。使用 KoViDoRe,我们评估了各种多模态检索模型,并观察到当前模型难以有效处理韩语视觉文档检索,特别是在涉及结构化内容和不同查询类型的设置中。受这一发现的启发,我们进一步策划了一个大规模训练数据集 Ko-VDR Train Public,以支持针对韩国视觉文档定制的检索模型的开发。 KoViDoRe 和 Ko-VDR Train Public 共同为韩语视觉文档检索提供统一的基准和训练资源。