论文
长文档中查询驱动的多模态信息抽取
Query-Driven Multimodal Information Extraction from Long Documents
摘要
在领域特定的多模态长文档中,图像和文本共同传达无法被纯文本完全捕捉的复杂知识。然而,DocVQA等现有范式主要聚焦于生成文本答案或定位证据区域,而不是输出查询指定的文本属性值和对应图像。为填补这一空白,我们提出查询驱动的图文联合抽取任务,要求模型输出查询所请求的文本属性值及对应图像边界框。基于与用户意图和文档内容相关的挑战,我们设计了在查询级和实例级运作的两级分类体系。进一步,我们构建ITJoint,该任务的首个高质量人工标注基准,包含2,455页含大量非装饰性图像的领域特定文档、316个查询和910个答案实例。最后,我们评估了来自不同提供商的代表性独立视觉语言模型,并进一步设计Q2IT,一个由三个渐进协作的智能体组成的协作框架,分别负责证据收集、页面选择和目标图像定位。采用同时评估文本抽取和图像定位的联合评估方法,实验表明独立VLM在该任务上表现挣扎,而Q2IT在ITJoint上显著提升性能,尽管距完美结果仍有相当差距。
