论文
长上下文视觉文档理解的内化推理
Internalized Reasoning for Long-Context Visual Document Understanding
摘要
视觉长文档理解对于企业、法律和科学应用至关重要,但性能最佳的开放式方法尚未探索推理,而推理是推动数学和代码性能飞跃的能力。我们引入了一种用于长文档理解推理的合成数据管道,通过对每个页面的问题相关性进行评分、提取文本证据并将其从最相关到最不相关进行排序来生成思维轨迹。我们将 SFT 应用于 \texttt{<think>} 标签内的结果轨迹,由 \texttt{<cot>} 控制词元进行门控,并且通过低强度模型合并将结果推理能力内化。我们研究了 Qwen3 VL 32B 和 Mistral Small 3.1 24B。借助 Qwen3 VL,我们在 MMLongBenchDoc 上取得了 58.3 的成绩,超过了大 7 倍的 Qwen3 VL 235B A22B (57.0)。通过 Mistral,我们发现综合推理在 MMLBD-C 上的 Thinking 版本轨迹中比 蒸馏 好 3.8 个点,并且与显式推理相比,内化推理的平均输出标记数减少了 12.4$\times$。我们发布了我们的管道以实现可重复性和进一步探索。