论文

确定性是多余的:利用视觉基础模型进行有效伪装目标检测的词元稀疏化

Certainty Is Redundant: Token Sparsification for Efficient Camouflaged Object Detection with Vision Foundation Models

模型优化稀疏化

摘要

伪装物体检测(COD)旨在分割与周围环境非常相似的物体。视觉基础模型 (VFM) 为 COD 提供了强大的可转移表示,但其大规模架构和全词元处理会产生大量计算开销。为了解决这个问题,我们提出了基于 VFM 的高效 COD 的确定性感知词元稀疏化(CATS)。 CATS 不是估计一般词元的重要性,而是根据其前景-背景确定性来确定每个词元是否仍需要更深入的细化。它逐步终止高确定性词元的独立更新,同时保留不明确的词元以进行进一步推理,从而缩短跨编码器阶段的活动词元序列。由于计算冗余并不意味着信息无关,因此我们进一步引入双路径特征补偿(DPFC),它将去除的前景和背景标记分别压缩为紧凑的确定性加权原型。跨多个 VFM、骨干规模、COD 架构和基准数据集的大量实验表明,我们的方法显着降低了计算成本,而精度仅略有下降,这表明基于 VFM 的 COD 具有良好的精度与效率权衡。代码将被发布。