论文
识别、定位、链接:从文档图像中提取端到端键值
Identify, Locate, Link: End-to-End Key-Value Extraction from Document Images
摘要
传统上,文档处理管道将光学字符识别 (OCR) 引擎与用于结构化信息提取的下游模型级联,从而导致多级错误传播。我们对 SmolDocling(一种紧凑的 256M 参数视觉语言模型 (VLM))进行微调,直接从文档图像中执行端到端键值提取,一次性联合解决识别、定位和关联问题,无需 OCR 预处理。我们使用专门的键、值、区域和链接标签扩展 DocTags,从而在统一的输出序列中实现多对多关系。为了解决数据限制,我们设计了一个增强管道,结合了合成表单填充和基于图的裁剪,以保留完整的键值子图。我们进一步介绍了一种布局感知评估框架,通过空间边界框验证扩展文本匹配。在 FUNSD、XFUND 和大型私有数据集上,我们的模型在布局感知评估下优于更大的零样本 VLM 基线,同时比 Qwen2.5-VL (7B) 小 27 倍,推理速度快 5 倍以上。模型权重将在发布后公开发布。