论文

经证明,混合 DeltaNet-Attention 解码器中的暂存器更短

Provably Shorter Scratchpads in Hybrid DeltaNet-Attention Decoders

模型架构混合架构

摘要

我们研究了混合循环注意力解码器的表达能力,这是最近开源语言模型(例如 Qwen3-Next 及其后继者)中使用的一类架构。这些模型将门控注意力头与循环门控 DeltaNet 头相结合。在模型表达力或效率方面,这种混合架构是否有正式的优势?我们证明确实存在。我们定义了奇偶条件检索任务,并表明在恒定精度假设下,门控 DeltaNet 和门控注意力的 Qwen 风格混合可以用恒定的暂存器或等效的 $O(1)$ 思维链步骤来解决此任务。相比之下,纯门控 DeltaNet 模型不存在类似的解决方案,而纯门控注意力至少需要一个多项式暂存器。