论文

HierDoc:用于长文档视觉问答的分层页面到区域证据路由

HierDoc: Hierarchical Page-to-Region Evidence Routing for Long-Document Visual Question Answering

上下文与知识上下文工程

摘要

多页文档视觉问答需要在页面和区域级别定位稀疏证据。现有的方法通常强调一个级别而不是另一个级别:以页面为中心的方法侧重于页面获取,区域操作主要用作导航辅助,而以区域为中心的方法假设已经提供了相关页面。因此,页面和区域选择保持脱节,而不是形成连续的证据决策。我们提出了 HierDoc,一种分层证据路由框架,它将长文档证据获取制定为从页面到区域的两阶段集预测。页面策略从完整文档中选择证据页面;然后解析这些页面的语义元素,之后区域策略选择传递到下游答案模型的元素。这两种与答案无关的策略都通过使用特定粒度的结构化集奖励的阶段性 GRPO 进行了优化。答案模型接收选定的整页以及选定的区域作物和 OCR 或表格文本,保留全局上下文,同时强调细粒度的证据。在评估的基准中,HierDoc 在开放权重系统中实现了最先进的或有竞争力的性能,相对于报告的最强开放权重基线,将 LongDocURL 提高了 16.87%。受控消融进一步表明,选定的区域证据将仅页面系统的准确性和 F1 分别提高了 5.51% 和 4.82%。这些结果证明了将粗粒度页面路由和细粒度区域路由组织为统一证据获取过程的连续的、单独优化的阶段的好处。