论文

TCP-SSM:具有词元条件极点的高效视觉状态空间模型

TCP-SSM: Efficient Vision State Space Models with Token-Conditioned Poles

摘要

状态空间模型(SSM)已成为远程视觉任务注意力模型的一个引人注目的替代方案,提供具有线性复杂性的输入依赖的递归。然而,最有效的 SSM 变体通过修改扫描路线、分辨率或遍历模式来降低计算成本,同时在很大程度上保留隐式的循环动态。因此,模型的状态相关内存行为难以控制,特别是在长扫描路径可能超出有效内存范围的紧凑主干中。我们提出了词元条件极点 SSM (TCP-SSM),这是一种结构化选择性 SSM 框架,可提高效率,同时通过稳定极点使递归动态变得明确且可解释。 TCP-SSM 使用 1)模拟单调或信号交替衰减的实极点和 2)捕获阻尼振荡响应的复共轭极点构建每个扫描算子。 TCP-SSM 使用有界半径和角度调制,将共享基极转换为词元相关极,允许每个扫描步骤使其内存行为适应当前视觉词元,同时保持极稳定性。为了实现实际的可扩展性,我们将分组极点共享与轻量级低秩输入路径集成,产生有效的扫描算子,保留线性时间扫描复杂性。在图像分类、语义分割和对象检测方面,TCP-SSM 将 Vision Mamba 式模型中的 SSM 计算复杂度降低了 44%,同时保持或超越了基线精度。