论文
用于精确定位文档中元素的 LMM
An LMM for Precisely Grounding Elements in Documents
摘要
文档中的视觉定位是大型多模态模型 (LMM) 在文档理解、深入研究和文档错误检测等领域的一项关键能力。然而,现有方法在文本丰富的文档图像中表现出较差的基础精度,通常无法准确定位可靠推理所需的关键文档元素。为了解决这一差距,我们引入了 PreciseDoc,这是一种专为精确元素定位而设计的 LMM,并且可以针对文档 VQA 任务进一步优化。具体来说,为了增强基本的定位能力,我们通过两个管道构建具有挑战性的训练数据,这些管道能够批量生成具有细粒度坐标配对元数据的高质量文档,包括具有相机效果的合成手工填充文档。该模型开发了更多现实世界的功能,超越了单一文本的直接本地化,例如从简历中查找个人信息。此外,我们引入了视觉扎根推理的训练范例,其中扎根和推理与强化学习联合监督,以提高扎根证据的贡献。对各种基准的综合评估表明了所提出的数据和方法在文档空间基础和文档理解方面的优势。