论文

通过分层实体探索实现高分辨率视觉感知

Towards High-Resolution Visual Perception via Hierarchical Entity Exploration

模型推理推理搜索与路径规划

摘要

高分辨率 (HR) 图像感知仍然是多模态 大语言模型 (MLLM) 中的一个关键挑战,因为当图像作为整体进行处理时,细粒度的细节通常会丢失。现有的方法要么需要训练来教会模型看哪里,要么启发式地将图像划分为固定区域,这两种方法都很难在复杂的 HR 场景中推广。在这项工作中,我们提出了分层实体探索(HEE),这是一种 无需训练 和模型无关的框架,可将静态图像理解转变为动态的、查询引导的实体探索。 HEE 首先使用双重评分机制评估每个区域,以确定它是否已经包含足够的证据来回答问题。如果没有,它会在最有希望的区域内应用对象检测来提取细粒度实体,将它们聚类成连贯的子区域,并将它们组织成多级语义层次结构以进行更深入的探索。当更深的区域仍然无法产生置信的答案时,置信引导的回溯机制会重新审视替代路径以确保自适应感知。大量结果表明,在 Qwen2.5-VL 和 LLaVA-OneVision 等不同 MLLM 上,HEE 在两个复杂 HR 基准(Visual Probe 和 HR-Bench)上的准确性和效率均优于 无需训练 方法(如 ZoomEye 和 RAP)。此外,HEE 还展示了 MME-RealWorld 基准的泛化能力。