论文
储层注意力网络:通过内容可寻址储层注入预训练 Transformer 中的交叉传递状态
The Reservoir Attention Network: Cross-Pass State in Pretrained Transformers via Content-Addressable Reservoir Injection
摘要
储层注意力网络 (RAN) 的可行性和动态研究,该架构将固定的、随机初始化的储层注入到预训练的 Transformer 的中间层注意力中,以在前向传递中传递状态。在单个消费级 GPU 上进行的实验涵盖 GPT-2(124M、355M)到 Qwen2.5(0.5B、1.5B)。这些任务是选择用于隔离各个机制的最小探针;更广泛的永远活跃的代理愿景始终被视为计算受限的未来工作,而不是本文的主张。存储库在设计上是未经训练的(固定随机):这隔离了未经训练的循环动力学是否足以承载可用的交叉状态,而将经过训练的循环作为补充,更昂贵的方向。