论文

用于细粒度识别的子词元视觉 Transformer

Subtoken Vision Transformer for Fine-grained Recognition

模型架构Transformer

摘要

我们提出了 Subtoken Vision Transformer (SubViT),这是一种用于细粒度视觉识别的选择性图像标记化方法。标准视觉 Transformer 将每个固定大小的补丁压缩为单个词元,尽管细粒度的区别通常取决于仅几个补丁内的局部变化。 SubViT 通过使用多个子词元表示有区别的补丁,同时保留全局上下文的原始词元序列,从而解决了这种不匹配问题,从而在最需要的地方分配额外的容量。由于注意力头编码互补语义,并且在推理时提取注意力图需要额外的主干前向,因此我们采用两阶段训练策略。第一阶段使用从随机注意力头采样的细分区域来微调 ViT,使模型暴露于不同的细分模式。第二阶段通过特征退化距离识别信息丰富的注意力图,并将其提炼成轻量级的单图路由器,该路由器直接预测确定性标记重要性分数,而无需单独的注意力转发。我们在广义类别发现(GCD)上评估 SubViT,这是一项具有挑战性的任务,需要细粒度的区分和对未标记的新类别的泛化。在 CUB、FGVC-Aircraft 和 Stanley-Cars 中,SubViT 将 DINOv2 的平均新颖类别准确度从 $81.3\%$ 提高到 $84.7\%$,仅增加 $0.50$ ms 的延迟,增加 $3.4\%$ 的 FLOPs,同时相对于 Retina Patch 减少了 $73.8\%$ 的延迟。代码:\href{https://github.com/jiezhu23/SubViT_ACCV26}{SubViT}。