VinQA:视觉元素交错的长格式答案生成,用于现实世界的多模式文档 QA
VinQA: Visual Elements Interleaved Long-form Answer Generation for Real-World Multimodal Document QA
摘要
现实世界的文档将文本与以不同布局排列的表格、图表、照片和图表相结合,但用于文档 QA 的多模式 大语言模型 (MLLM) 的现有研究主要产生纯文本响应,而没有充分利用这些视觉元素。我们引入了 VinQA,这是一个用于生成长格式答案的数据集,其中引用的视觉元素与其支持文本明确交错,并基于相关文档页面。为了支持这项任务,我们研究了两种将原始文档页面图像输入 MLLM 的编码方法,以及它们的视觉元素引用机制:(1)页面编码,它直接用视觉元素的边界框对整页图像进行编码,并将这些加框区域视为可引用单元; (2)模态编码,解析每个页面以提取文本并裁剪视觉元素,分别对其进行编码,并将这些裁剪后的元素用作可引用单元。在我们的实验中,我们提出了 M-GroSE,这是一种多模式评估框架,扩展了 GroUSE,可以从四个维度评估答案:完整性、答案相关性、忠实性 和不可回答性。我们还报告了 Visual Source F1 以直接测量视觉引用准确性。尽管专有前沿模型在 VinQA 测试分组中仍然取得了最佳总体分数,但 微调 在训练分组中开放 Qwen2.5-VL 模型大大提高了其性能并缩小了这一差距。模态编码最初对于具有长文本、许多视觉元素和不同引用要求的复杂文档更加稳健。然而,经过 VinQA 训练后,页面编码达到了相当的水平,即使没有模态编码中使用的显式解析,也能有效竞争。最后,基于 MLLM 的评审 Visual G-Eval 确认,经过微调的模型在语义上适当的位置插入了视觉元素,并提供忠实的支持文本。