论文
文本、像素还是兼用?面向多模态文档问答的输入表征评估
Text, Pixels, or Both? Evaluating Input Representations for Multimodal Document QA
摘要
每个文档问答系统都始于一个很少被单独研究的选择:是给模型页面图像、抽取文本,还是两者兼用。我们隔离这一选择——固定提示、裁判与评分流水线——跨越四个商业模型端点、两个语料库与两种上下文设定(金标证据页与完整文档)。在图像预算可容纳的文档上,页面图像在两个语料库的所有文档长度上准确率领先,但这一优势伴随不断增长的时延与成本溢价:文本时延随文档变长大致平稳,而图像时延稳步上升。文本与图像也在不同问题上失败:在报告的各单元格中,19–25%的问题恰好只有一种表征答对,因此两者互不包含。利用这种互补性,一个仅读问题文本的轻量TF-IDF路由器相对始终用文本获得2.6个百分点的提升,同时相对始终用视觉将中位时延降低30%(在文档不相交的留出划分上)。
