论文

用于高分辨率物体检测的可变粒度标记化

Variable-Granularity Tokenization for High-Resolution Object Detection

模型推理推理加速

摘要

ViT 检测器在任何学习阶段之前修复统一的标记网格。然后,原始分辨率的航空探测器必须在解析少数像素物体和保持在计算和内存限制之间进行选择。我们引入了 VGTok,一个 无需训练 分词器,它在编码器之前根据像素设置每个区域的补丁粒度。 VGTok 通过多尺度形态学顶帽与其周围的可分离性对每个区域进行评分,然后将这些分数设置为每个图像百分位数的阈值,从而修复了 词元预算。结构张量门 ($λ_{\min}$) 仅在二维对象结构支持的情况下进行细化,而使一维杂波变得粗糙。生成的标记集是图像的严格分区。在具有 EVA-02 ViT-L 编码器的 Co-DETR 检测器中,VGTok 在每个预算(从 40\% 到 100\% 的词元)中清除每个已发布的 VisDrone-val AP 和 AP$_S$。在 40% 时,它记录了 44.22 AP,在第一个 Transformer 块之前丢弃了序列的五分之三;密集,达到 48.38 AP,比最强的已发布条目高出 6​​.08 美元。 VGTok 未受影响地转移到 AI-TOD-v2,具有相同的得分手和相同的排名,并将新的技术水平设置为 37.27 AP 和 19.51 AP$_{vt}$。作为纯粹的冻结检查点,它以 78.5% 的词元达到 36.29 AP,高于每个已发布的条目,其中我们的 376.3M 参数检测器清除了 3.0B 多专家模型。我们证明,仅从局部可分离性和结构几何形状来看,在主干之前固定的 词元预算 就可以在主导空中检测的微小物体状态上保持精度,编码器计算量减少 3.1 倍,编码器内存减少 1.9 倍。代码和模型可在 \href{https://github.com/khayrulbuet13/vgtok}{\texttt{github.com/khayrulbuet13/vgtok}} 和 \href{https://huggingface.co/khayrulbuet13/vgtok}{\texttt{huggingface.co/khayrulbuet13/vgtok}} 获取。