论文
Q-Zoom:高效多模态的查询感知自适应感知 大语言模型
Q-Zoom: Query-Aware Adaptive Perception for Efficient Multimodal Large Language Models
摘要
MLLM 需要高分辨率视觉输入来执行文档理解和密集场景感知等细粒度任务。然而,当前的全局分辨率缩放范例不加区别地用视觉冗余的标记淹没二次自注意力机制,严重阻碍推理吞吐量,同时忽略空间稀疏性和查询意图。为了克服这个问题,我们提出了 Q-Zoom,一种查询感知的自适应高分辨率感知框架,以高效的从粗到细的方式运行。首先,当粗略的全局特征足够时,轻量级动态门网络可以安全地绕过高分辨率处理。其次,对于需要细粒度感知的查询,自蒸馏区域提议网络(SD-RPN)直接从中间特征空间精确定位与任务相关的感兴趣区域(RoI)。为了有效地优化这些模块,门控网络使用一致性感知生成策略来派生确定性路由标签,而 SD-RPN 采用完全自我监督的 蒸馏 范例。然后,连续时空对齐方案和目标 微调 将密集的局部 RoI 与粗略的全局布局无缝融合。大量实验表明 Q-Zoom 建立了主导帕累托前沿。使用 Qwen2.5-VL-7B 作为主要测试平台,Q-Zoom 在文档和 OCR 基准测试中将推理速度提高了 2.52 倍,在高分辨率场景中将推理速度提高了 4.39 倍,同时匹配了基线的峰值准确度。此外,当配置为最大感知保真度时,Q-Zoom 在这些各自的基准测试中比基准的峰值性能高出 1.1% 和 8.1%。这些强大的改进可以无缝转移到 Qwen3-VL、LLaVA 和新兴的基于强化学习的图像思维模型。项目页面位于 https://yuhengsss.github.io/Q-Zoom/。