论文
VisDocAgentBench:视觉丰富文档检索的基准代理
VisDocAgentBench: Benchmarking Agents for Visually Rich Document Retrieval
摘要
视觉丰富的文档通过语言、布局、结构化视觉元素和语料库上下文对相关性进行编码,但检索通常是通过一次性查询(页面匹配)来评估的。代理搜索基准通常对下游问答或报告生成进行评分,从而导致迭代证据获取下的文档排名尚未得到充分探索。我们引入了 VisDocAgentBench,这是一个封闭语料库基准测试,比较共享排名输出合约下的静态和代理检索。它包含 100 个文档和 120 个独特目标查询的 2,375 页,在直接、一桥和两桥证据结构中保持平衡。保留关系的构造产生语义、关系和视觉查询,然后进行完整文档审查和硬否定验证。强大的后期交互视觉 检索器 在直接项目上达到 97.50% Recall@1,但在两桥项目上达到 2.50%,暴露了当相关性取决于语料库上下文时查询目标匹配的局限性。智能体弥补了大部分损失,但规划者的选择和检索表示仍然是决定性的。每个规划人员在视觉检索方面都表现更好,其最佳 R@1 达到 67.50%,而 OCR 文本的 R@1 为 37.50%。消融将迭代搜索和页面检查视为重要的功能,并且提供完整的支持上下文可以提高这两条路线的排名。跟踪分析将剩余的损失定位于目标发现、候选人检查和证据角色整合。这些发现激励检索代理将模态保留发现与证据导向验证相结合。