论文

DORA:视觉 Transformer 中用于词元合并的动态在线强化代理

DORA: Dynamic Online Reinforcement Agent for Token Merging in Vision Transformers

模型推理推理加速

摘要

由于自注意力相对于词元序列长度的二次复杂度,Vision Transformer (ViTs) 会产生大量的计算开销。虽然现有的词元减少方法缓解了这个问题,但它们主要依赖于固定的启发式指标、预定义的比率或静态离线掩码,这些方法缺乏在推理过程中捕获依赖于输入的冗余的适应性。在本文中,我们提出了 DORA(动态在线强化代理),这是第一个强化学习(RL)驱动的在线推理框架,用于 ViT 中的动态词元合并。我们将合并过程制定为顺序马尔可夫决策过程(MDP),其中轻量级 RL 代理根据当前特征状态和特定于层的上下文确定每个 Transformer 块的合并策略。为了平衡计算效率和特征保真度,代理通过密集奖励函数结合基于非线性 蒸馏 的惩罚进行优化。我们实现了一种非对称的 Actor-Critic 架构,利用高容量的 Critic 进行稳定的离线训练,同时保留最小的 Actor 头用于低计算量的在线推理。跨多个 ViT 尺度(从小到大)的评估表明,与当前基线相比,DORA 提高了准确性-效率 Pareto 前沿。在严格的可忽略的准确度下降约束(<= 0.05%)下,DORA 实现了高达 12.66% 的词元合并率,并且相对于最有效的基准提高了 569.7%。在 ImageNet-1K 上,在一致的精度约束下,与最先进的方法相比,DORA 在计算节省方面实现了高达 76% 的相对改进。此外,在 ImageNet-A 和 ImageNet-C 等分布式(OOD)基准测试中,DORA 获得了超过 430% 的相对效率优势。