论文
ASAP:通过切片双投影摊销双随机注意力
ASAP: Amortized Doubly-Stochastic Attention via Sliced Dual Projection
摘要
双随机注意力已经成为行 softmax 注意力的基于传输的替代方案,最近的 Transformer 变体使用它来减少注意力下沉和排名崩溃,同时提高性能。在这个系列中,标准方法是 Sinkhorn 缩放,它训练效率更高,但仍然在每个推理前向传递中重复矩阵缩放。切片传输注意力消除了在线迭代,但其软排序近似实现了每个切片的密集张量,比 Sinkhorn 注意力需要更多的训练资源。我们引入了 ASAP:通过切片对偶投影进行摊销双随机注意力,这是一种先训练后编译的方法,使用 Sinkhorn 训练双随机层,然后用固定的切片对偶运算符替换推理时的迭代缩放循环。它学习从精确的一维 Kantorovich 势到 Sinkhorn 查询端对偶的轻量级参数映射,然后使用双边熵 c 变换重建注意力计划。在语言和视觉基准测试中,ASAP 保持了更便宜的训练设置,并且与最近的基准相比仍然具有高度竞争力。在主要的冻结层基准测试中,ASAP 比经过训练的 Sinkhorn 老师快 5.3,同时匹配其准确性;在下游替换中,ASAP 无需任何再训练即可恢复大部分教师绩效。