论文
用于通用文档视觉问答的领域适应 VLM 的比较研究
Comparative Study of Domain-adapted VLMs for General Document Visual Question Answering
摘要
文档视觉问答 (DocVQA) 提出了复杂的多模式挑战,要求模型利用文档中的视觉、文本和布局信息。尽管视觉语言模型(VLM)在文本视觉任务中表现出了卓越的性能,但它们的鲁棒性和向不同文档领域的可迁移性仍未得到充分探索。在本研究中,我们对 DocVQA 上的 8 个开源预训练 VLM 在三个不同文档领域进行了综合评估:不同类型的工业文档、信息图表和演示幻灯片。我们系统地评估零样本评估下的模型性能,通过数据集间和数据集内评估进行完全监督的微调,以及领域之间知识转移的小样本学习评估。我们的研究结果表明,虽然大型预训练 VLM 具有针对结构化布局的强大的零样本基线,但它们的性能在信息图表和幻灯片的视觉复杂布局上大幅下降。尽管参数缩放是性能的主导因素,但监督微调在较小的架构中会产生更高的相对增益。此外,我们的跨域和少样本实验表明,视觉理解是 DocVQA 的主要瓶颈,而不是缺乏 VLM 的知识。使用 50 个目标域样本,在 DocVQA 中使用不同域的数据集进行微调的模型可以快速适应目标域文档,在某些情况下甚至超过了完全监督的模型。