论文
DTFormer:以多 VLM 语义先验对齐 RGB-D 分割
DTFormer: Text-Guided Semantic Alignment for RGB-D Segmentation
摘要
RGB-D 语义分割通过融合 RGB 和深度取得了显着进展,但主流模型仍然几乎完全从像素级监督中学习特征,缺乏直接的高级语义约束。这就提出了一个核心问题——语言先验等外部知识能否为主流RGB-D分割模型注入更强的语义辨别能力。我们提出了 DTFormer,一种新颖的三模态(RGB-D-Text)语义分割框架。其核心是文本引导语义对齐模块 (TSAM),它首先将文本线索编码为一组语义原型,然后在多个编码器和解码器层将多模态 RGB-D 特征与这些原型显式对齐。这种设计对表示学习施加了强大的语义正则化,引导网络获得更具辨别力的特征。对多个基准的大量实验表明,DTFormer 能够提供一致的增益,同时保持简单和高效。我们的结果表明,显式语义对齐为改进 RGB-D 语义分割提供了有效且实用的途径。该代码将在接受后发布。
