论文
BVS:使用多模态 大语言模型 进行贝叶斯视觉搜索,实现细粒度感知
BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception
摘要
虽然多模态 大语言模型 (MLLM) 展示了令人印象深刻的一般功能,但它们在超高分辨率 (UHR) 图像中的细粒度感知方面遇到了困难,特别是对于杂乱场景中的微小物体。现有的方法面临着一个困境:它们要么依赖于低效的无先验扫描,要么依赖于静态先验驱动的启发式算法,而这些启发式算法缺乏后验校正来纠正初始模型偏差。为了解决这个问题,我们提出了 BVS(贝叶斯视觉搜索),这是一个将感知表述为连续空间尺度流形上的全局优化问题的框架。具体来说,BVS 将先验指导与后验校正联系起来:它利用 MLLM 的提前停止注意力机制来构建推理感知先验,同时采用尺度感知非平稳内核和 GP-UCB 来动态纠正噪声并通过迭代局部观察恢复先验中丢失的信息。我们通过亚线性遗憾界限提供理论保证,并且大量实验表明,BVS 显着优于最先进的基线,在准确性和效率之间取得了卓越的权衡。