论文

深度循环注意力混合:给潜在推理应有的注意力

Depth-Recurrent Attention Mixtures: Giving Latent Reasoning the Attention it Deserves

模型架构MoE递归架构

摘要

深度循环通过跨深度共享参数来促成潜在推理。然而,先前工作缺乏FLOP、参数与内存同时对齐的基线,由于部分固定的层堆叠而未充分利用深度循环,并忽视了限制多步潜在推理的固定隐藏维度瓶颈。为解决这一点,我们提出深度循环注意力混合(Dreamer)的模块化框架,结合序列注意力、深度注意力和稀疏专家注意力。它通过沿深度的注意力缓解隐藏维度瓶颈,解耦各扩展维度,使深度循环模型能够高效且有效地扩展。在语言推理基准上,与FLOP、参数和内存对齐的SOTA相比,我们的模型在相同准确率下所需训练token减少2到8倍,并在相同训练token下胜出约大2倍的SOTA模型。我们进一步给出关于跨深度知识使用的洞见,例如专家选择多样性比SOTA MoE大2到11倍。

深度循环注意力混合:给潜在推理应有的注意力
图2:深度-递归注意力混合(depth-recurrent attention mixture,Dreamer)的展开高层示意。它展示了此实例化中的三个注意力维度:序列注意力(水平方向)、深度注意力(垂直方向)与专家注意力(z 轴方向)。实心方框表示当前/最新 token 与深度上的活跃元素,空心方框为非活跃元素。Q/K/V = query/key/value。