论文

块式可微分 Sinkhorn 注意力:带有间隙感知垃圾箱桥的尾部细化梯度

Block-Wise Differentiable Sinkhorn Attention: Tail-Refinement Gradients with a Gap-Aware Dustbin Bridge

模型架构Transformer

摘要

我们通过停止基础、固定深度尾部细化代理来研究 TPU 硬件上的长上下文平衡熵最优传输 (OT) 注意力。在停止 $T$ 步骤 Sinkhorn 求解后,我们展开一个短的细化尾部并精确区分该代理项。对于报告的 $R=2$ TPU 路径,后向传递包含四个楼梯计划因子。我们证明了一个精确的单参考图块计划:$R=2$ 分数余切是单个参考计划图块乘以由向量余切和对偶差构建的显式修饰符字段。这会产生块级成本 $O((T+R)LW)$、$O(Ld)$ 输入存储,以及平衡固定支撑路径上固定头尺寸 $d$ 和带宽 $W$ 的额外 HBM 使用量 $O(L)$。我们还将当前的\texttt{dustbin\_block}路径形式化为增强支持上的相同单元目标代理,因此伴随调度提升到我们的TPU运行中使用的单活动垃圾箱路径;该桥是代数桥,并不要求采用一般的 KL 不平衡或任意容量间隙模型。我们为严格正主动块提供局部代理偏差界限、后验偏差证书和投影收缩证书。在合成屏蔽问题上,优化后的内核将相同中心代理的自动差异精确匹配到 $10^{-5}$--$10^{-10}$ 范围内。在 TPU v6e-8 上,四配置 Pfam 屏幕完成端到端,并且提升的平衡 $R=2$ 运行通过三小时的预算维持每秒大约 8.5$ 的示例,达到步骤 $1437$。相对于步骤 $0$,保留的 Pfam 测试分片将重建从 $5.57$ 提高到 $2.05$,稀疏 CE 从 $5.53$ 提高到 $5.30$,CE 进行诊断记录而不是直接优化;目标重心对齐指标并没有实质性改善,并且确定性对角线参考在这些指标上仍然更强。