论文
DocSeeker:面向长文档理解的证据依据对齐结构化视觉推理
DocSeeker: Structured Visual Reasoning with Evidence Grounding for Long Document Understanding
摘要
现有多模态大语言模型(MLLM)在长文档理解任务上随文档长度增加出现显著性能下降。这源于两个根本挑战:1)信噪比(SNR)低,关键证据被埋没在无关页面中;2)监督稀缺,仅提供最终简短答案的数据集只能给出微弱的学习信号。本文提出一种要求模型执行结构化「分析-定位-推理」(Analysis, Localization and Reasoning)工作流的范式来应对这些挑战。为注入该能力,我们设计了两阶段训练框架:首先在通过高效知识蒸馏策略生成的高质量数据上进行监督微调(SFT)。随后,我们采用证据感知的组相对策略优化(Evidence-aware Group Relative Policy Optimization),联合优化证据定位与答案准确率。此外,我们引入证据引导的分辨率分配策略,以缓解多页文档训练的内存约束。大量实验表明,DocSeeker在域内与域外任务上均取得更优性能。我们证明它能从短页训练稳健地泛化到超长文档,并与视觉检索增强生成(RAG)系统天然协同,可作为其实现的坚实基础。
