论文
Reason Twice:通过候选发现和比较推理进行细分
Reason Twice: Segmentation via Candidate Discovery and Comparative Reasoning
摘要
预训练基础模型的快速发展使得更通用的图像分割成为可能。多模态 大语言模型 (MLLM) 已被广泛探索用于具有需要高级推理的复杂查询的图像分割。尽管取得了可喜的进展,但现有方法往往受到有限的训练数据以及 MLLM 和掩模生成模块之间的差距的限制。为了更好地将 MLLM 的感知和推理能力转移到基于推理的复杂分割任务,我们提出了一个用于掩模生成和选择的两阶段框架 Rea2Seg。具体来说,该框架首先根据分割 MLLM 的注意力图将潜在区域识别为候选掩模。然后,它使用 MLLM 对问题和候选掩码进行推理,并为每个掩码分配分数。最终的分割结果是通过对候选者重新排序并选择得分最高的掩模,将图像分割重新表述为候选者发现,然后是判别性掩模选择来获得的。我们还注意到,现有基准测试中的很大一部分问题都集中在常识推理上,而这些问题通常并不完全需要联合视觉观察和推理。为了解决这个问题,我们引入了一个名为 ReasonSeg-SGDR 的新基准,该基准全面评估模型在多个维度上的感知、基础和推理能力,包括判别识别、空间推理、几何推理和多步推理,以及细粒度掩模生成。此外,我们还收集训练数据,以增强 MLLM 共同理解多模态查询和候选掩码并通过推理分配分数的能力。所提出的基准和 ReasonSeg 的实验结果证明了统一掩模生成和选择框架的有效性。