论文

GridProbe:长视频 VLM 中自适应测试时间计算的后探测

GridProbe: Posterior-Probing for Adaptive Test-Time Compute in Long-Video VLMs

模型推理测试时计算扩展

摘要

VLM 中的长视频理解受到以二次注意力成本对数千帧进行单片前向传递的瓶颈。常见的缓解措施是在前向传递之前首先选择一小部分信息帧;通过辅助编码器空间相似性,无需训练 选择器很常见。此类信号受到对比预训练的限制,而对比预训练通常在推理繁重的查询(否定、跨帧计数、整体总结)中失败。我们提出了 GridProbe,这是一种高效的 无需训练 后验探测推理范式,它使用冻结的 VLM 自身推理对答案空间中的证据进行评分,然后自适应地选择与问题相关的帧,从而产生次二次注意力成本,几乎没有准确性损失。我们将帧排列在 $K{\times}K$ 网格上,并运行轻量级的行 R 和列 C 探针,其中每个探针读取其峰值后验作为查询条件置信度。 R 和 C 的外积产生一个可解释的重要性图,其偏度和峰度驱动形状自适应选择,这是一种封闭式规则,可以用每个问题 $M_{\mathrm{eff}}$ 可靠地替换固定框架预算 $M$。我们凭经验证明,$M_{\mathrm{eff}}$ 在没有看到答案的情况下跟踪内在问题的难度,这是测试时自适应计算的标志。在 Video-MME-v2 上,GridProbe 在 $1.6$ pp 平均 Acc 内匹配整体基线,减少 $3.36\times$ TFLOPs,而在 LongVideoBench 上,它帕累托主导基线($+0.9$ pp,$0.35\times$ 计算)。由于选择器和 QA 模型可以解耦,因此将小型 2B 选择器与更强的 4B 或 8B QA 配对在 2B 整体基线上是严格帕累托主导的(平均在 0.52\times$ 计算下高达 $+4.0$ pp),无需重新训练。最后,重要性图的可解释性为行为诊断、基础和框架选择 蒸馏 的未来开辟了途径。