论文
通过场景感知文档合成增强大型多模态模型的关键信息提取
Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis
摘要
关键信息提取 (KIE) 将视觉丰富的文档转换为结构化数据,但实际部署仍然具有挑战性:强大的性能通常依赖于昂贵的服务器上大型多模态模型 (LMM),而紧凑的本地可部署模型缺乏足够的 KIE 监督。我们推出 SAYRE,一种场景感知文档合成框架,用于生成可扩展的 KIE 训练数据,无需手工制作模板设计。给定一些示例文档,SAYRE 捕获特定于类别的内容模式和布局约定来合成文档-模式-注释三元组。它进一步引入了错误驱动生成,将现实世界的失败案例扩展为困难的训练示例,同时保留其结构模式。在约束类别和开放类别 KIE 上的实验表明,SAYRE 持续改进了 Qwen3-VL 主干网,并在设备上的 LMM 中实现了最强的整体性能。随着更多合成数据的引入,数据扩展实验显示出总体上升趋势,特别是对于较小的模型和开放类别提取。错误分析进一步表明,综合训练通过改进对密集表、业务标识符和合同条款的模式感知提取来减少字段级错误。这些结果将场景感知综合确立为一种有效的以数据为中心的方法,用于改进实用的多模态 KIE。