论文

FlowSeg:LLM 条件分割的动态语义指导

FlowSeg: Dynamic Semantic Guidance for LLM-Conditioned Segmentation

应用与实践视觉感知与空间理解

摘要

LLM 条件分割最近通过将 大语言模型 与迭代掩模生成框架相结合而迅速发展。然而,我们在当前的“提议然后选择”管道中发现了一种持久的故障模式。尽管经常生成高质量的候选掩模,但最终的预测可能无法匹配给定的语言条件。出现这种失败的原因是语言语义通常用作静态提示或事后匹配信号,而不是参与迭代掩码生成过程。通过系统分析,我们发现许多错误源于语义错位,而不是掩模质量差。为了解决这个问题,我们提出了 FlowSeg,它在整个生成过程中通过中间解码状态和 LLM 派生的条件嵌入之间的双向语义流引入了动态语义指导。语言条件在每个阶段积极指导掩模细化,而条件嵌入则通过新出现的视觉证据逐步更新。这种设计产生基于语义的掩码表示和视觉上对齐的语言条件,从而实现更可靠的匹配。我们进一步结合了轻量级边界感知改进,以选择性地增强不确定区域,而不干扰自信的内部。关于引用表达分割和推理分割任务的大量实验表明,FlowSeg 持续改进了语言掩码对齐并实现了最先进的性能。项目页面:https://zkzhang98.github.io/FlowSeg_page