论文

LIRSeg:用紧凑潜在推理替代分割任务的显式思维链

Skip the Talk, Re-Focus on Vision: Latent Reasoning for Reasoning Segmentation in Multimodal Large Language Models

模型推理模型训练强化学习推理策略与问题分解

摘要

推理分割旨在解释隐式文本查询并实现细粒度的视觉感知,这对于人机交互和实体代理等应用至关重要。现有方法通常在定位目标之前通过多模态大语言模型 (MLLM) 生成显式思想链 (CoT)。尽管直观,但这种明确的言语推理会引入大量的注意力干扰:冗余的文本标记会在感知标记生成过程中扰乱注意力,并且还会增加视觉标记之间的有效距离。为了解决这个问题,我们提出了 LIRSeg,它用一组紧凑的可学习潜在标记完全取代了显式 CoT,用于推理分割。 LIRSeg 分两个阶段进行训练:空间对齐将潜在标记置于与对象相关的视觉证据中,GRPO 通过分割奖励进一步优化它们。为了使这些紧凑的潜在标记更具信息性,我们从信息角度引入了三种互补机制:用于选择信息丰富的训练信号的极端优势采样,用于学习互补表示的解耦探索稳定性更新,以及用于防止表示崩溃的潜在多样性放大。大量基准实验表明 LIRSeg 持续提高了分割精度和推理效率。与 VisionReasoner 基线相比,LIRSeg 在 ReasonSeg 上实现了 4.9% 的绝对 gIoU 改进,在 MUSE 上实现了 7.1%,在 MMR 上实现了 4.7%,同时推理标记减少了约 16 倍。代码可在补充材料中找到。