论文

视觉丰富的文档类型分类的多模态方法:比较分析

Multimodal Approaches for Visually-Rich Document Type Classification: A Comparative Analysis

模型评测模型能力评测

摘要

视觉丰富的文档中的文档类型分类仍然具有挑战性,因为相关信息分布在文本、视觉和布局模式中。为了捕捉这种复杂性,当前的方法依赖于不同的多模态建模策略,导致异构架构使系统比较变得复杂。这种变异性也反映在现有的比较研究中,这些研究通常依赖于异质的评估设置,使系统比较进一步复杂化,并使得评估进展变得困难。为了解决这些限制,这项工作对基于 Transformer 和 LLM 的架构的多模态设计策略进行了结构化分析,并结合统一实验框架内的受控实证比较。具体而言,在 RVL-CDIP 基准上评估了四种代表性模型(LayoutLMv3、Donut、Qwen3-VL-32B-Instruct 和 Qwen3-32B),以系统地分析文本、图像和布局信息对文档类型分类的贡献,特别关注对比依赖 OCR 的方法和不依赖 OCR 的方法。结果表明,在视觉丰富且布局密集的文档上,专门的多模式 Transformer 优于基于 LLM 的方法。图像信息对可靠分类的贡献最大,而 OCR 派生文本提供有用但次要的支持。这些发现强调,多模式处理对于具有明显布局结构的文档仍然至关重要。总体而言,该研究为比较多模式架构提供了系统基础,并为选择有效的特征组合和文档类型分类模型设计提供了实用指导。