论文

DTFormer:以多 VLM 语义先验对齐 RGB-D 分割

DTFormer: Text-Guided Semantic Alignment for RGB-D Segmentation

应用与实践视觉感知与空间理解

摘要

RGB-D 语义分割通过融合 RGB 和深度取得了显着进展,但主流模型仍然几乎完全从像素级监督中学习特征,缺乏直接的高级语义约束。这就提出了一个核心问题——语言先验等外部知识能否为主流RGB-D分割模型注入更强的语义辨别能力。我们提出了 DTFormer,一种新颖的三模态(RGB-D-Text)语义分割框架。其核心是文本引导语义对齐模块 (TSAM),它首先将文本线索编码为一组语义原型,然后在多个编码器和解码器层将多模态 RGB-D 特征与这些原型显式对齐。这种设计对表示学习施加了强大的语义正则化,引导网络获得更具辨别力的特征。对多个基准的大量实验表明,DTFormer 能够提供一致的增益,同时保持简单和高效。我们的结果表明,显式语义对齐为改进 RGB-D 语义分割提供了有效且实用的途径。该代码将在接受后发布。

DTFormer:以多 VLM 语义先验对齐 RGB-D 分割:论文原图
图 4:我们的 DTFormer 的总体架构。 (a)四级编码器和三级解码器。编码器提取多尺度特征,而解码器逐步上采样并细化分割预测。 (b) 编码器中的 RGB-D-T 块,其中 TSA-E 在几何自注意力 (GSA) 之后应用。 (c) 图像特定文本生成和 TSAM 变体的详细信息。左:两个不同的 VLM 使用相同的提示查询输入图像,交集过滤仅保留两个模型预测的类名以减少幻觉,每个图像产生大约 4-8 个高置信度类名。这些类名被包装到模板中并由冻结的 CLIP 文本编码器进行编码。右图:TSA-D(解码器)采用具有 Pre-LayerNorm、温度缩放余弦注意力和 MLP 的丰富 Transformer 块进行细粒度细化,而 TSA-E(编码器)仅使用轻量级温度缩放余弦注意力进行高效语义注入。两种变体都使用可学习的门控来逐步进行语义对齐。