论文

AVIS:视觉语言模型的自适应测试时间缩放

AVIS: Adaptive Test-Time Scaling for Vision-Language Models

模型推理测试时计算扩展

摘要

现代视觉语言模型 (VLM) 受益于思维链提示和测试时间扩展,但由于较大的视觉上下文和较长的解码链,这些收益往往会带来高昂的推理成本。我们通过两个耦合轴来查看此成本:视觉上下文缩放(VCS),它控制将多少视觉证据传递到语言模型;以及视觉推理缩放(VRS),它控制执行多少推理时间推理搜索。现有方法通常一次优化一个轴,而跨这些轴的联合计算分配尚未得到充分探索。我们引入了自适应视觉推理缩放 (AVIS),这是一种轻量级策略,可以根据查询调整 VCS 和 VRS。 AVIS 通过密钥多样性视觉 (KDV) 剪枝实现 VCS,这是一种基于 无需训练 $O(N)$ 密钥的规则,用于在预填充之前删除冗余视觉标记,并通过自适应自我一致性实现 VRS,使用学习的难度预测器来选择推理采样轨迹的数量。 AVIS 部署友好,并且与共享预填充推理兼容,其中所有采样轨迹都复用单个预填充通道和 KV 缓存。在不同的图像和视频推理基准中,AVIS 提高了准确性——相对于仅 VCS 和仅 VRS 基线的计算权衡,并且在 RL 后训练 VLM 之上保持有效,同时保持较低的计算和延迟。