论文
从识别到推理:对现实世界收据文档理解的 MLLM 进行基准测试和增强
From Recognition to Reasoning: Benchmarking and Enhancing MLLMs on Real-World Receipt Document Understanding
摘要
从可视文档中提取结构化信息(视觉信息提取,VIE)是业务自动化的基石。虽然最近的 Multimodal 大语言模型 (MLLM) 显示出有前途的功能,但现有基准在规模和现实性方面受到严重限制,缺乏语义粒度,并且无法涵盖不同的文档类型。为了弥补这一差距,我们引入了 ReceiptBench,这是一个由 10k 个不同收据组成的大规模人工注释基准,将信息提取组织为四个分层子任务:(1)用于原始文本识别的基本感知,(2)用于严格遵循标准化指令的格式规范化,(3)用于从上下文推断隐式属性的语义推理,以及(4)用于处理嵌套行项目的结构解析。此外,我们提出了一个包含度量感知组相对策略优化(GRPO)的两阶段训练框架,它将严格的评估约束转化为强化学习信号,以增强结构一致性。大量的实验表明,我们的方法具有最先进的性能,在复杂推理任务上超越了领先的专有模型。我们在 https://github.com/wwwT0ri/ReceiptBench 发布了我们的数据集和代码。