论文
当词元压缩失效时:结构修剪与词元减少在高压缩下实现稳健的 ViT 分割
When Token Compression Breaks: Structural Pruning vs. Token Reduction for Robust ViT Segmentation under High Compression
摘要
Vision Transformer (ViTs) 是语义分割的强大支柱,但其计算成本限制了部署。最近用于基于 Transformer 的高效分段的词元压缩方法通过减少词元数量来降低此成本。然而,现有的评估主要集中在低到中度的压缩上,使得它们在剧烈压缩和损坏的输入下的行为不清楚。同时,结构剪枝通过删除 ViT 架构中的冗余组件提供了提高效率的正交途径,但很少与统一协议下的词元压缩相比。为了弥补这一差距,我们在 ADE20K 和 Cityscapes 及其常见损坏变体 ADE20K-C 和 Cityscapes-C 上对基于 ViT 的语义分割在匹配 FLOP 下的代表性词元压缩和结构修剪方法进行了基准测试。我们的结果揭示了干净输入和损坏输入的一致趋势:词元压缩在轻度减少时非常有效,但当压缩变得严重时急剧下降,这与过度激进的词元减少造成的大量信息丢失一致。相比之下,结构修剪表现出更平滑的退化曲线,并且在高压缩下更稳定。受这些发现的启发,我们研究了一种修剪然后合并的管道,该管道在适度修剪的主干之上应用适度的词元压缩。在可比较的 FLOP 下,这种组合策略始终能够在高压缩下实现更好的准确性与鲁棒性权衡,为面向部署的 ViT 分段提供实用的方案。代码可在 https://github.com/phatnguyencs/vit-seg-compression 获取。