论文
Found but Not Read:文档VLM的检索-阅读鸿沟
Found but Not Read: When Extracted Text Closes the Retrieval-Reading Gap in Document Vision-Language Models
摘要
检索增强的文档问答假设:一旦找到正确的页,视觉语言模型(VLM)就能读它。我们证明该假设经常失效,留下检索-阅读鸿沟:证据被找到但未被使用。配对协议隔离该差距:比较仅用检索页图像的回答与同图像加其提取文本的回答。在我们带可追溯证据的FoveDoc-Bench上,检索几乎找到每个证据页,但加入CPU-OCR文本使严格准确率提升13至16点;精确文本层使增益约翻倍,跨三族六个VLM出现,同族内随规模收窄但不闭合。读取器读得到证据却找不到它:证据裁剪恢复大部分文本增益,页面上的框则毫无作用。同一协议识别两个边界:提取文本对文本类证据有帮助,对图表与图形中性或有害;随检索退化优势缩小,同形无关文本无可检测增益。提取文本是有效检索的放大器,不是失效检索的替代品。代码/项目页:https://github.com/atoz03/fovedoc-sup。