论文
FIRM:用于遥感推理分割的掩模的细粒度词元内表示
FIRM: Fine-Grained Intra-Token Representation of Masks for Remote Sensing Reasoning Segmentation
摘要
推理分段需要多模态 大语言模型 (MLLM) 将隐式指令转换为精确的像素级掩码。 MLLM 将图像编码为视觉标记,每个标记合并一组图像块。在遥感图像中,小目标、薄结构和相邻实例可以占据同一视觉标记的不同部分。为此类标记分配单个二进制掩码标签会丢失其内部空间结构,导致附近的目标合并并且对象边界变得粗糙。为了弥合这种表征差距,我们引入了 FIRM,一种掩码的细粒度词元内表征。对于每个视觉标记,FIRM 预测一个掩码,该掩码指定 $r\times r$ 二进制子单元模式,而不是单个前景/背景标签。给定 MLLM 识别的目标,可以在一次掩模传递中预测完整的掩模代码网格。固定查找将预测的代码转换为离散的子单元掩码,同时边缘化代码分布产生软结构字段。为了进一步恢复每个子单元内的细粒度边界,我们引入了一种轻量级连续渲染器,它使用预合并视觉特征和图像细节来细化该领域。在卫星和无人机图像的五个推理和参考分割基准中,FIRM 取得了领先的结果,包括 LaSeRS 上 70.5 美元/80.5 美元的 gIoU/cIoU 以及 EarthReason 上 3.0 美元点的平均收益。这些结果证明了显式表示细粒度 MLLM 分割的词元内掩码模式的价值。