论文
关于 Mamba 中的召回缩放定律:通过哈希进行的理论和机制研究
On the Recall Scaling Laws in Mamba: A Theoretical and Mechanistic Study via Hashing
摘要
联想回忆 (AR) 是学习和检索记忆中项目之间联系的认知能力。在 NLP 中,AR 被用作评估 Mamba 等架构的上下文记忆能力的基准,并且被发现与语言建模性能密切相关。本文从机械可解释性的角度探讨 AR,旨在对 Mamba 用于执行召回的精确内部算法进行逆向工程。我们的主要见解是,Mamba 通过隐式学习线性哈希函数来执行召回,并且我们确定了实现此行为的低级电路。基于这些发现,并受到保留相似性散列理论工具(例如 Johnson-Lindenstrauss 引理)的启发,我们开发了一个用于分析 AR 的理论框架,我们将其称为召回缩放定律。给定上下文中的词汇量和事实数量,该框架允许我们(1)预测 Mamba 实现完美召回所需的嵌入和状态维度,(2)在给定模型维度的情况下预测召回成功概率,以及(3)分析多层模型和多头 SSM 模式。实证结果表明,我们的理论研究结果是准确且具有预测性的,为 AR 容量如何随词汇、状态、嵌入大小和架构进行扩展提供了见解。