论文
回答前的分割:MLLM 视觉推理的像素定位
Segmentation before Answering: Pixel Grounding for MLLM Visual Reasoning
摘要
多模态 大语言模型 (MLLM) 的最新进展已从静态感知发展到交错视觉语言推理,通常称为“用图像思考”。此推理过程中的基本操作是放大感兴趣的区域(通常用边界框表示)以获取更精细的视觉细节。在本文中,我们提出在 \textbf{Answer}ing (SegAnswer) 之前进行 \textbf{Seg}mentation,它将放大单位从流行的边界框转移到像素级分割掩模。通过采用细粒度掩模将目标区域与杂乱的环境隔离开来,分段视觉输入可产生更精确的感兴趣区域,从而有效地滤除冗余背景和干扰物体。此外,分段视觉输入的离散补丁与 MLLM 通过位置嵌入构建视觉标记的方式更加无缝地结合。在实验中,我们通过不同的基准评估 SegAnswer,包括高分辨率感知、一般感知和幻觉。它实现了持续的改进,并且在分割任务上也表现出了相当大的性能,验证了其可靠像素定位的能力。