论文

按需聚焦:免训练视觉定位的自适应路由与协作定位

Focus When Necessary: Adaptive Routing and Collaborative Grounding for Training-Free Visual Grounding

模型推理测试时计算扩展

摘要

多模态大语言模型擅长跨模态推理,却常难以识别复杂高分辨率图像中的细节。免训练方法通常通过缩放和局部裁剪改善观察,但对所有问题一律执行这些操作会产生冗余计算,也可能截断关键全局信息或引入背景噪声。LazyMCoT根据样本难度自适应分配视觉定位工作。其自适应路由使用一次前向计算的首词元统计评估不确定性,跳过有把握的简单样本,并通过保形校准保障困难样本的召回。对于困难样本,协作定位模块通过两阶段细化,将模型自身的跨模态注意力与外部视觉专家结合,生成精确的局部视图以识别细小或被遮挡目标。多项基准实验显示,该方法同时提高推理准确率、降低平均推理延迟,效果可与需要训练的方法相比。代码:https://github.com/TencentBAC/LazyMCoT。