论文

DRAgent:用于引用表达分割的判别推理代理

DRAgent: Discriminative Reasoning Agent for Referring Expression Segmentation

模型推理推理验证与自校正

摘要

引用表达式分割(RES)旨在为语言表达式指定的对象生成像素级掩模。最近基于多模态 大语言模型 (MLLM) 的方法通常依赖于视觉定位的一次性坐标预测,这将连续的空间位置序列化为离散文本标记,并可能导致定位偏差和对齐错误。为了解决这些问题,我们提出了 DRAgent,一种 MLLM 驱动的 RES 判别推理 (DR) 框架。 DRAgent 不需要 MLLM 生成定位坐标,而是首先构建检测器生成的候选空间,然后使用 MLLM 作为视觉语义目标鉴别器。具体来说,MLLM 通过两阶段 DR 机制在潜在干扰因素中执行可靠的目标选择,该机制首先筛选高召回率候选者,然后执行实例验证。选定的目标框随后用作基础分割模型的空间提示,以生成最终的像素级掩模。此外,我们为基于LoRA的微调构建了一个自一致性过滤的推理链数据管道,为增强MLLM的判别推理能力提供更可靠的监督。实验表明,DRAgent 在 RefCOCO、RefCOCO+ 和 RefCOCOg 上实现了具有竞争力的性能。