论文
注意力感知路由:MoE中路由与注意力的耦合
Attention-Aware Routing: Coupling Routing and Attention in MoEs
摘要
在混合专家(MoE)语言模型中,路由器通常仅基于token的隐藏状态来选择并加权专家,所利用的上下文信息有限。我们提出注意力感知路由(AAR),用从注意力权重滑动窗口中提取的时序与频谱特征来增强路由器,这些特征代表模型上下文状态的摘要,并与隐藏状态解耦。我们在基础Transformer完全冻结的前提下仅训练路由参数,将路由隔离为唯一变量。在OLMoE上,AAR相比仅微调路由的SFT基线将GSM8K提升3.37个百分点。除性能提升外,我们证明路由与注意力构成耦合回路:第l层的路由变化经残差流传播,会在第l+1层放大注意力汇聚(attention sink),在未直接更新注意力机制的情况下重塑注意力。此外,AAR减少了发散的长生成:错误答案变短,而正确答案长度不变。最后,AAR对深度高度敏感:不加区分地应用于所有层可能损害事实检索,而在网络较深处引入时数学推理增益依然保持。这种敏感性揭示了跨深度的检索—推理张力,并使层选择性AAR成为探测不同层注意力所携带路由相关信息的受控探针。
