论文

GTR:用于高效密集预测的门控词元循环

GTR: Gated Token Recurrence for Efficient Dense Prediction

模型架构递归架构

摘要

基于自注意力的视觉主干在密集预测方面表现良好,但随着图像分辨率的提高,全局 softmax 注意力的二次计算成本限制了它们的效率。我们引入了门控词元循环(GTR),这是一种无 softmax 的循环视觉主干,它结合了门控线性注意力、交替空间扫描方向和空间增强的 SwiGLU 块。 GTR 是从专门检测的 DINOv3 教师中提炼出来的,仅使用通过线性投影和平方 $\ell_2$ 损失进行的最终层补丁词元对齐,没有屏蔽词元预测或中间层监督。通过 Objects365 检测器预训练,GTR-L 在 RTX~4090 上编译的 FP16 执行下,在 COCO \texttt{val2017} 上实现了 58.9 盒 AP,中值批次一延迟为 1.908\,ms。相同的主干还转移到实例分割、姿态估计、定向检测、语义分割和单目深度估计。在独立的内核基准测试中,我们专门的分块 CUDA 运算符在 RTX~4090 上以 1.6K 词元的速度比 FLA v0.5.0 快 4.0 倍。 DRIVE AGX Thor 上的 TensorRT 部署在评估的模型中实现了 2.282--8.769\,ms 中值批次一延迟。这些结果表明,循环词元混合可以为高分辨率密集预测和边缘部署提供全局 softmax 注意力的有效替代方案。项目页面:此 https URL