论文

文本、像素还是兼用?面向多模态文档问答的输入表征评估

Text, Pixels, or Both? Evaluating Input Representations for Multimodal Document QA

模型评测模型能力评测

摘要

每个文档问答系统都始于一个很少被单独研究的选择:是给模型页面图像、抽取文本,还是两者兼用。我们隔离这一选择——固定提示、裁判与评分流水线——跨越四个商业模型端点、两个语料库与两种上下文设定(金标证据页与完整文档)。在图像预算可容纳的文档上,页面图像在两个语料库的所有文档长度上准确率领先,但这一优势伴随不断增长的时延与成本溢价:文本时延随文档变长大致平稳,而图像时延稳步上升。文本与图像也在不同问题上失败:在报告的各单元格中,19–25%的问题恰好只有一种表征答对,因此两者互不包含。利用这种互补性,一个仅读问题文本的轻量TF-IDF路由器相对始终用文本获得2.6个百分点的提升,同时相对始终用视觉将中位时延降低30%(在文档不相交的留出划分上)。

文本、像素还是兼用?面向多模态文档问答的输入表征评估:论文配图
图 1:三种文档表示使用相同的问答提示与裁判。图像保留版式与视觉内容。文本紧凑且不受页数上限约束。文本+图像将 OCR 文本与页面图像拼接,代价是更大的上下文。