论文
ContourVLA:用于广义引用表达分割的闭环感知动作轮廓策略
ContourVLA: A Closed-Loop Perception-Action Contour Policy for Generalized Referring Expression Segmentation
摘要
广义指称表达分割 (GRES) 需要动态平衡高级语义,以识别可变数量的语言指定的指称,并使用细粒度的视觉证据来精确描绘边界。这一要求对现有的级联视觉语言架构提出了挑战,这些架构通常依赖于静态特征接口和单通道掩模预测,限制了自适应感知和几何校正。我们引入了 ContourVLA,这是一种视觉-语言-动作策略,它将 GRES 重塑为闭环视觉运动过程,其中可编辑轮廓作为明确的策略状态,调节多模态感知并通过几何动作块进行更新。进化感知语义调度(EASS)将轮廓引导的双向边界采样与多级多模态特征的状态条件路由结合起来,使感知适应每个轮廓状态。在监督初始化之后,Dustbin 增强熵信用传输 GRPO (DECT-GRPO) 通过实例级联合优化离散接地和连续轮廓动作 学分。它的推出奖励和积分源自软预测目标对应关系,该对应关系解释了误报和错过目标的情况。 ContourVLA 在 gRefCOCO val、testA 和 testB 上的最强评估基线上分别将 gIoU 提高了 8.7、2.8 和 2.7 个点,并在所有 8 个 RefCOCO、RefCOCO+ 和 RefCOCOg 分割中实现了最高的 mIoU。