论文
Docs2Synth:面向扫描版视觉富文档理解的合成数据训练检索器框架
Docs2Synth: A Synthetic Data Trained Retriever Framework for Scanned Visually Rich Documents Understanding
摘要
受监管领域的文档理解(VRDU)尤为困难,因为扫描文档常包含敏感、动态演进且领域特定的知识。这带来两大挑战:缺乏用于模型适配的人工标注,以及预训练模型难以跟上领域特定事实的更新。多模态大语言模型(MLLM)虽有强大的零样本能力,但仍受幻觉与领域证据关联不足的困扰;相比之下,判别式视觉-语言预训练模型(VLPM)提供可靠的证据定位,却需要昂贵的标注来覆盖新领域。我们提出 Docs2Synth,一个合成监督框架,为私有与低资源领域实现检索引导的推理。Docs2Synth 自动处理原始文档集合,通过基于智能体的系统生成并验证多样的问答对,并训练一个轻量视觉检索器来抽取领域相关证据。推理时,检索器通过迭代检索-生成循环与 MLLM 协作,减少幻觉并提升响应一致性。我们还将 Docs2Synth 交付为易用的 Python 包,可在多样真实场景中即插即用部署。在多个 VRDU 基准上的实验表明,Docs2Synth 无需人工标注即可显著增强证据定位能力与领域泛化。
