论文
DINOde:用于开放词汇语义分割的连续视觉文本对齐
DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation
摘要
开放词汇语义分割 (OVSS) 利用文本语义来分割预定义类别之外的对象。虽然自监督模型 DINOv3 提供了强大的结构化视觉表示,但其缺乏本地文本对齐阻碍了其直接应用于 OVSS。为了弥补这一差距,我们提出了 DINOde,这是一个基于 ODE 的框架,它不断地将 CLIP 文本嵌入与 DINO 视觉流形保持一致。我们的方法采用两个互补的组件:(i) 语义文本流 (STF),它通过连续的 ODE 轨迹将文本嵌入演化为 DINO 流形;(ii) 全局上下文流 (GCF),它逐步细化 DINO 的 CLS 词元所承载的整体图像表示。为了在演化过程中保留特征空间的超球面几何形状,我们进一步引入了速度切线投影,它将学习到的速度场限制在切线空间。通过将对齐建模为连续轨迹,DINOde 避免了离散 MLP 投影中固有的流形纠缠,并产生更稳健的跨模态对齐。大量实验表明,DINOde 始终优于现有方法,并在多个 OVSS 基准测试中实现了最先进的性能。该代码可在 https://github.com/yoon307/DINOde 获取。