论文

CVSearch:通过认知视觉搜索为多模态 LLM 提供支持,以实现高分辨率图像感知

CVSearch: Empowering Multimodal LLMs with Cognitive Visual Search for High-Resolution Image Perception

模型推理推理搜索与路径规划

摘要

高分辨率 (HR) 图像感知是多模态 大语言模型 (MLLM) 的关键瓶颈。虽然视觉搜索提供了一个有前途的解决方案,但现有方法在覆盖范围和效率之间进行权衡。视觉专家辅助搜索虽然高效,但在提案失败时容易出现盲点,而基于扫描的搜索则以计算冗余和语义碎片为代价来保证覆盖范围。为了解决这个困境,我们引入了 CVSearch,这是一个 无需训练 自适应框架,它通过评估然后搜索工作流程动态安排搜索策略。具体来说,CVSearch 在全局信息不足时首先调用专家辅助搜索,并且仅在失败时触发新颖的语义感知扫描机制。与严格的网格划分不同,这种高效的扫描范例结合了语义引导自适应修补,将图像分解为语义一致的区域,从而有效地减少了对象碎片。此外,我们设计了一种由视觉复杂性驱动的动态自下而上搜索策略,以实现对局部细节的高效和精确的迭代探索。针对 HR 基准的大量实验表明,CVSearch 实现了最先进的准确性,同时大幅提高了搜索效率。代码发布于 https://github.com/liliupeng28/ICML26-CVSearch。