论文
图表可以帮助视觉 SSM 看得更清楚吗?
Can Graphs Help Vision SSMs See Better?
摘要
视觉状态空间模型继承了曼巴式选择性扫描的效率和远程建模能力。然而,它们的性能关键取决于将二维视觉特征表示为一维标记序列。现有的扫描运算符的范围从预定义的几何遍历到基于动态坐标的采样器,这些采样器通过预测的偏移和插值重新路由标记。虽然有效,但这些机制主要适应路径或采样位置,而不是明确建模哪些本地补丁应在全局状态空间混合之前交换信息。这就引发了一个简单的问题:\emph{图可以帮助视觉状态空间模型看得更好吗?}我们引入 \textbf{GraphScan},这是一种用于视觉 SSM 的图诱导动态扫描算子。对于每个标记,GraphScan 构建一个空间有界的局部图,学习具有相对位置偏差的特征条件亲和力,并通过传递其语义邻域的一步消息生成输出标记。生成的词元在由选择性 SSM 处理以进行全局聚合之前先在本地局部空间关联。 GraphScan 保留了标记计数和图像大小的线性缩放,同时用特征条件语义路由替换坐标条件插值。 \textbf{GraphScan-Mamba} 集成到分层主干中,在图像分类、对象检测、实例分割和语义分割方面实现了 Vision SSM 中最先进的性能,并且计算开销适中。我们的分析进一步表明,GraphScan 在词元晶格上引起可解释的位移场,提供动态扫描的语义和空间基础视图。这些结果表明,未来的 Vision SSM 不应仅仅将扫描视为几何序列化,而应将其视为在全局状态空间建模之前学习的本地语义路由。