论文

文档作为图像的表示不足以进行科学检索

Document-as-Image Representations Fall Short for Scientific Retrieval

模型评测基准与评测资源

摘要

最近的许多文档嵌入模型都是在文档即图像表示上进行训练的,将渲染的页面嵌入为图像而不是底层源。与此同时,现有的科学文档检索基准(例如 ArXivQA 和 ViDoRe)将文档视为页面图像,隐含地倾向于这种表示形式。在这项工作中,我们认为这种范式不太适合文本丰富的多模式科学文档,其中关键证据分布在结构化来源中,包括文本、表格和图形。为了研究这种设置,我们引入了 ArXivDoc,这是一个根据科学论文的底层 LaTeX 源构建的新基准。与 PDF 或基于图像的表示不同,LaTeX 提供对结构化元素(例如,部分、表格、图形、方程)的直接访问,从而实现基于特定证据类型的受控查询构造。我们系统地比较了单向量和多向量检索模型中的纯文本、基于图像和多模态表示。我们的结果表明:(1)文档作为图像的表示始终不是最佳的,尤其是随着文档长度的增加; (2) 通过利用图注和周围的上下文,即使对于基于图形的查询,基于文本的表示也是最有效的; (3) 交错的文本+图像表示优于文档即图像方法,无需专门训练。