论文

用于长文档 QA 的 VLM 管道的实证研究

An Empirical Study of VLM Pipelines for Long-Document QA

模型评测模型能力评测

摘要

视觉语言模型 (VLM) 越来越多地用于长文档处理,其中输入将文本与图表、表格、图形和复杂布局相结合。部署它们意味着选择如何将文档提供给模型、仅发送页面子集时使用哪个检索器,以及是否以代理方式运行模型或作为静态管道运行模型。我们使用前沿 API 和开放权重 VLM 在两个长文档 QA 基准上研究这些选择。首先,在 MMLongBench-Doc 上,只有当应答 VLM 足够大时,我们的包含页面、表格、图形和搜索调用的六工具代理才能获得回报:使用 Qwen3.5-4B 和 9B,它落后于静态页面输入,使用 Qwen3.5-27B,它保持水平,使用 Sonnet 4.5,它领先。在 LongDocURL 上,它与每个读者的静态输入相同或领先。它对最强静态管道的领先优势在 MMLongBench-Doc 上的前沿阅读器中最为明显,并且在 LongDocURL 上缩小到噪音范围内。其次,检索方式比特定检索器更重要:最强的图像检索器引导最强的文本管道,而在文本方面,单个现成的交叉编码器重新排序本质上与更重的多级 LLM 管道相匹配。对于我们与之配对的每个读者来说,Top-k 图像检索也是最有效的词元输入,大约是发送每个页面的词元的七分之一到四分之一。第三,纵观所有三个选择,我们最强的三个管道在不同的问题上取得了成功,并且为每个问题选择最佳管道的预言机比最佳单个管道获得了大约 13 分,尽管证据类型路由几乎没有恢复它。