论文

多模态视觉问答的问题引导证据获取

Question-Guided Evidence Acquisition for Multimodal Visual Question Answering

智能体系统Agent 工具调用

摘要

多模式 LLM 可以查看文档,但他们通常无法可靠地读取它。即使页面已经位于模型的上下文中,小文本、表格、视觉提示和拓扑元素仍然会在直接视觉推理下绊倒它们。大多数文档 VQA 系统将感知视为固定的:它们对页面进行一次编码,提出问题,然后从模型在单个快速通道中提取的任何内容进行回答。我们认为文档 VQA 需要更慢、更深思熟虑的感知:模型应该在推理时花费一些额外的计算来确定接下来要看什么,然后再回答,而不是从一种固定的编码中回答。我们将其构建到 \textbf{Q-Guide} 中,这是一个小型代理,可以读取问题,找出它仍然缺少的证据,并调用目标工具来恢复它——在需要文本的地方阅读文本,在需要细节的地方放大,或者在位置重要的区域定位。在 DocVQA2026 和 Manga109 上,Q-Guide 的性能优于直接提示和最新的多代理文档系统(DocVQA2026 上 $65.0\%$ vs.\ $40.0\%$,Manga109 $32.4\%$ vs.\ $24.4\%$),并且改进在三个 Claude 主干(Opus 4.6、Sonnet)上保持不变。 4.6 和 Opus 4.5)。我们发现准确性与感知预算成正比——大部分增益出现在两到三轮深思熟虑的回合内——并且增益来自将感知引导到正确的位置,而不是来自复杂的控制逻辑:添加规划器、路由器或多个协作代理没有帮助。