论文

SeGDeP:语义和几何感知解耦提示进行推理分割

SeGDeP: Semantic- and Geometric-Aware Decoupled Prompts for Reasoning Segmentation

模型架构新型架构

摘要

推理分割将隐含的语言结论转换为精确的掩模,需要语义识别和空间基础。现有的 MLLM 分段器接口要么使用特殊的触发器,要么将两种信号压缩到一个上下文中,尽管它们接收不同的监督并以不同的方式失败。这种耦合掩盖了失败是由目标解释还是本地化引起的。我们提出 SeGDeP,一个明确的 What-Where 接口。语义提示分支和独立的几何投影路径将解析的 MLLM 状态转换为语义特征和 DETR 预测框,共同调节 SAM 3 掩模解码器。训练首先对齐这个可执行接口,然后使用组奖励解耦策略优化(GDPO)来平衡格式、box-IoU 和 mask-IoU 反馈。 SEGDeP-4B 在 8 个 RefCOCO 系列分裂中达到 82.7 的平均 cIoU,在 ReasonSeg val/test 上达到 66.0/59.6 gIoU,同时通过 LoRA 仅调整 0.38% 的 Qwen3-VL 参数。受控的分阶段消融、梯度诊断和及时干预进一步表明,这两条路径发展了互补的语义和几何专业化,而不是重复相同的证据。