论文

LOCI:具有细化循环的定位器批评家

LOCI: A Locator-Critic with Refinement Loop

模型推理推理验证与自校正

摘要

视觉语言模型(VLM)仍然难以完成需要复杂视觉理解的任务。我们认为核心问题不是高级推理,而是未能找到图像中的关键细节。由于这个缺点,VLM 通常会基于有缺陷的感知基础生成看似合理但不正确的推理。为了解决这个问题,我们提出了 Locator-Critic (LOCI),这是一个 无需训练 框架,它将视觉搜索与证据验证分离。 LOCI 使用 Locator 代理来提出候选视觉证据,并使用单独的 Critic 代理来评估其相关性和充分性。这些代理参与迭代细化循环,逐步改进证据,直到足以回答给定的问题。这种解耦、自我校正的过程带来了显着的性能提升,在多个复杂的视觉基准上实现了最先进的结果。 LOCI 提高了 Qwen3-VL 等开放重量模型(V* 上+12.1,HR-Bench 上+5.8,VisualProbe-Hard 上+11.2)和 Gemini 2.5 Pro 等专有模型(V* 上+8.9,HR-Bench 上+4.3,VisualProbe-Hard 上+4.8)的精度。