论文
REDI:DINOv3 词元减少的 Corpus Aware 图像块排序
REDI: Corpus Aware Patch Ranking for DINOv3 Token Reduction
摘要
Vision Transformer 的大多数词元减少方法通过修剪、合并或池化补丁词元来寻求准确性和效率之间的有利权衡。 REDI (Relevance for DINOv3 Token Reduction) 通过受控监督参考研究了这个问题:如何在图像分类的补丁之间分配固定的 词元预算? REDI 将最终块 DINOv3 补丁表示量化为视觉词汇,并使用视觉词上的监督 TF-IDF 导出类条件语料库分数。对于每个验证图像,真值 类选择 TF-IDF 表的一行,四个转换后的视图生成与参考中心裁剪对齐的 TF-IDF 地图。对同一作物进行单独的密集传递可提供注意力图。在独立的最小最大归一化之后,它们的元素乘积定义了 REDI 分数。然后,固定的保留、合并和压缩运算符使用分数排名来分配补丁角色,并使用分数大小来加权合并和压缩。通过预先计算的 REDI 分数、冻结的 DINOv3 ViT-B/16 主干以及用于密集评估的相同线性分类器,操作员将序列长度从 201 个标记减少到 107 个标记,序列减少了 46.8%。基于传入注意力质量的 REDI 变体在 ImageNet-1K 上实现了 84.706% 的 Top-1 准确率,相比之下,密集基线为 83.514%,单独传入注意力质量为 82.634%,单独有监督 TF-IDF 为 81.796%。相对于仅注意的对应项,同一语料库术语还改进了三种替代注意公式的简化分类。总之,这些受控比较表明,特定于类别的语料库统计数据和特定于图像的注意力为该设置中的图像块排序提供了补充信号。