论文
双重注意力残差
Dual Attention Residuals
摘要
最近的工作沿着两个互补的轴扩展了 Transformer 残差路径:历史检索从早期深度选择信息,而多流方法维护多个残差轨迹。这些功能在很大程度上是孤立研究的,并且为每个流分配独立的 检索器 仍然可以防止一个轨迹影响另一个轨迹的深度选择。我们提出了双重注意力残差(DAR),它通过相互跨流寻址将多流交互带入历史检索中。对于每个目标流,DAR 根据相反流中的归一化状态计算深度权重,并将其应用于目标流自身历史记录中的值。检索到的状态组合为未更改的 Transformer 分支,并通过约束门控写入进行更新;块形式变体对块级历史进行操作以控制开销。在从 0.1B 到 1B 参数的密集模型和 7B 稀疏 MoE 模型中,DAR 始终改善了标准残差 Transformer 和注意力残差的验证损失。路由消融表明,增益不能仅用额外的流或价值预测来解释。表示和干预分析进一步表明,相互跨流选择保留了深度方面的多样性,并避免了在替代双流设计中观察到的冗余或功能不平衡。