论文

角色解耦的注意力残差:跨深度分离匹配与内容检索

Role-Decoupled Attention Residuals: Separating Matching and Content Retrieval Across Depth

模型架构Transformer

摘要

深度路由残差架构允许Transformer层检索之前的表示,而不是继承仅前一个状态。然而,现有的Block Attention Residuals使用单一的内容依赖深度混合来构造输入到查询、键和值。这种设计耦合了两个功能不同的决策:查询和键决定注意力匹配的位置,而值决定检索的内容。因此,我们询问是否匹配和内容检索应该强制从相同的深度读取。我们引入了角色解耦注意力残差(RD-AttnRes),这是一种最小的扩展,共享一个深度路线来查询和键,同时学习独立的值路线使用相同的残差源。将两个路由完全耦合恢复了父架构,而解耦它们仅引入每层一个模型宽度向量,没有引入额外的token-to-token注意力操作。我们使用冻结的、配对的预训练协议在FineWeb-Edu上进行评估,使用了五组匹配的种子模型,参数大小分别为120M和343M,以及2.0B的训练预算。RD-AttnRes在所有10个匹配比较中提高了验证的负对数似然性。平均减少量分别为0.0301和0.0247,对应于120M和343M参数下的困惑度减少2.97%和2.43%。早期预算控制表明,额外的参数数量、重复的路由执行或固定的值路线均无法重现改进。路由诊断进一步揭示了查询-键和值深度分布之间的持续差异。这些结果表明,在评估的训练环境中,注意力匹配和内容检索从残差层次结构中受益于不同的读取。