论文
DocTrace:通过分层证据图推理实现可追溯长文档视觉问答
DocTrace: Towards Traceable Long Document VQA via Hierarchical Evidence Graph Reasoning
摘要
长文档视觉问答(LongDocVQA)要求大型多模态语言模型(MLLMs)来定位、集成和推理分布在多个页面上的异构文档元素。现有的方法,包括端到端的MLLMs、增强检索生成(RAG)管道和文档代理,往往缺乏表示和验证证据如何逐步组合以进行推理的明确机制,限制了答案准确性和可追溯性。在这篇论文中,我们把LongDocVQA视为一个显式的证据图推理问题,而不是隐式的答案预测。为此,我们提出DocTrace,这是一个分层框架,逐步执行证据定位、结构化的文档解析和证据图推理,以实现明确的证据来源。为了有效地学习这些能力,我们开发了一个两阶段训练框架:首先进行联合监督微调(SFT),初始化证据定位和图推理能力,然后通过专门奖励的任务特定组相对策略优化(GRPO)进一步优化这些能力。我们在MMLongBench-Doc、LongDocURL和SlideVQA上进行了广泛的实验,证明DocTrace在现有开源基准和专用MLLMs中持续优于表现。与Qwen3-VL-8B-Instruct主干相比,DocTrace分别在三个基准上实现了绝对改进14.4、11.3和11.7点。除了竞争性的性能之外,DocTrace构建了带有明确节点级来源的可追溯证据图,使长文档理解中的透明且可验证推理成为可能。
