论文
深度循环注意力混合:给潜在推理应有的注意力
Depth-Recurrent Attention Mixtures: Giving Latent Reasoning the Attention it Deserves
摘要
深度循环通过跨深度共享参数来促成潜在推理。然而,先前工作缺乏FLOP、参数与内存同时对齐的基线,由于部分固定的层堆叠而未充分利用深度循环,并忽视了限制多步潜在推理的固定隐藏维度瓶颈。为解决这一点,我们提出深度循环注意力混合(Dreamer)的模块化框架,结合序列注意力、深度注意力和稀疏专家注意力。它通过沿深度的注意力缓解隐藏维度瓶颈,解耦各扩展维度,使深度循环模型能够高效且有效地扩展。在语言推理基准上,与FLOP、参数和内存对齐的SOTA相比,我们的模型在相同准确率下所需训练token减少2到8倍,并在相同训练token下胜出约大2倍的SOTA模型。我们进一步给出关于跨深度知识使用的洞见,例如专家选择多样性比SOTA MoE大2到11倍。
