论文

具有跨模态注意先验的文本引导视觉依赖图学习

Text-Guided Visual Dependency Graph Learning with Cross-Modal Attention Priors

应用与实践视觉感知与空间理解

摘要

从多模态视觉语言特征估计可解释的条件依赖结构在很大程度上仍未被探索。我们提出了 CM-GLasso(跨模态图形套索),这是一个连接视觉语言表示学习和稀疏高斯图形模型的框架。 CM-GLasso 引入了三个关键组件:(i) 文本可视化策略,将类属性描述渲染为图像,并通过与自然图像相同的 SigLIP-2 视觉编码器对其进行处理,在共享特征坐标系中产生原型索引的补丁级注意力足迹; (ii) 交叉注意力 蒸馏 机制,将高维补丁压缩为一小组语义图节点,其注意力足迹相似性产生非均匀 L1 惩罚的跨模态结构先验; (iii) 联合 ADMM 公式,估计单个凸目标内的共享和特定于类的精度分量,避免首先估计然后分解单独的类图的需要。学习到的稀疏图拓扑直接支持无参数、基于精度的分类规则和轻量级拓扑感知分割头。对八个基准的大量实验表明,与强大的基于功能和特定任务的基准相比,CM-GLasso 实现了具有竞争力或优越的性能。在匹配的受控协议下,它在VOC(74.75%)和ADE20K(64.01%)的受控基线中获得了最高的平均分类精度(91.97%)和最高的分割mIoU,同时还产生具有公共特定分解的显式稀疏条件依赖图。