论文
Doc-V*:多页文档 VQA 从粗到细的交互式视觉推理
Doc-V*:Coarse-to-Fine Interactive Visual Reasoning for Multi-Page Document VQA
摘要
多页文档视觉问答需要对长且视觉密集的文档中的语义、布局和视觉元素进行推理。现有的无 OCR 方法面临着容量和精度之间的权衡:端到端模型随文档长度的扩展性很差,而基于视觉检索的管道又脆弱又被动。我们提出了 Doc-$V^*$,一个 \textbf{OCR-free Agentic} 框架,它将多页 DocVQA 转换为顺序证据聚合。 Doc-$V^*$ 从缩略图概述开始,然后通过语义检索和目标页面获取主动导航,并在结构化工作记忆中聚合证据以进行有根据的推理。通过专家轨迹的模仿学习进行训练,并通过组相对策略优化进一步优化,Doc-$V^*$ 平衡了答案准确性和证据寻求效率。在五个基准测试中,Doc-$V^*$ 的性能优于开源基准并接近专有模型,与 RAG 基准相比,域外性能提高了 \textbf{47.9\%}。其他结果揭示了通过选择性注意进行有效证据聚合,而不是增加输入页面。