三思而行:高分辨率 VQA 的中间层证据路由
Thinking Once Is Enough: Intermediate-Layer Evidence Routing for High-Resolution VQA
摘要
高分辨率视觉问答(HR-VQA)通常被视为证据获取不足的问题,其中失败的多模态 大语言模型 必须通过裁剪、重新编码或多轮搜索再次检查图像。我们证明这种观点是不完整的:在许多情况下,细粒度的证据已经在视觉编码中幸存下来,并在中间层路由窗口中变得可识别和有影响力,但后来在答案生成之前被稀释。我们提出 Thinking-Once,一种\textbf{无需训练,单视觉传递}证据路由方法,该方法在此窗口重建问题条件注意力,保留核心实体标记和紧凑的背景上下文,并将这些证据路由到后面的层,而无需额外的视觉编码。在五个基本模型中,Thinking-Once 持续改进或匹配相应的基本设置,将 V$^*$Bench、HRBench-4K 和 HRBench-8K 的平均分数提高 \textit{+3.1}、\textit{+3.0} 和 \textit{+2.7} 点,同时将平均峰值内存减少约 4 GB。在 Qwen2.5-VL-7B 上,它将三个基准提高了 \textit{+9.9}、\textit{+4.6} 和 \textit{+5.5} 点,将交叉基准平均值从 72.5 提高到 79.1。使用 ZwZ-8B 基本模型,Thinking-Once 的平均得分为 82.7。针对 11 个开源 HR-VQA 基线,它在所有三个基准平均值和最佳总体平均值上获得了最佳或并列最佳分数;例如,与 DeepScan 相比,它减少了 V$^*$Bench 推理时间 \textbf{97.2\%},同时将交叉基准平均值从 77.8 提高到 79.1。这些结果表明,可以通过路由已经编码的证据而不是重复获取新的视觉输入来改进 HR-VQA。代码可在附录中找到。