论文

DocMIDE:学习视觉富文档中的多跳隐式推导

DocMIDE: Learning Multi-Hop Implicit Derivation in Visually Rich Documents

模型训练强化学习奖励建模与过程监督RLVR

摘要

真实世界的文档处理系统依赖僵化的预定义模式,而关键目标字段往往在页面上没有直接的视觉对应物。提取这些隐式值需要多跳推导,例如聚合子类别或对视觉标记进行推理。现有方法虽能处理显式文本片段或简单隐式查询,但即使在标准微调后也无法完成多跳视觉推理:模型要么检索到错误的视觉证据,要么检索正确却在推导中跳过中间步骤。为此我们提出 DocMIDE,一个微调框架,训练紧凑的视觉-语言模型在推导答案之前显式检索视觉证据。DocMIDE 将生成约束为计划-检索-推导结构,并用 Group Relative Policy Optimization 在四组件的基于规则的奖励下优化:对照经过验证的参考轨迹,评分输出格式、检索到的证据块、每个中间推导步骤以及最终值。在一个 4,151 对的隐式抽取基准上,DocMIDE 仅用少量标注样本就将 Qwen3.5-4B 的准确率从 70.8% 提高到 95.9%,并迁移到第二个骨干架构。在我们测试的任何预算下,仅靠监督示例都无法弥补这一差距;对中间步骤给予奖励才是关键。

DocMIDE:学习视觉富文档中的多跳隐式推导:论文配图
图 6:在 Qwen3.5-4B 上使用 DocMIDE,在不同数量 n 的标注训练样本下的留出集总体准确率。