论文
循环Transformer的共享记忆出人意料地有效
The Surprising Effectiveness of Shared Memory in Looped Transformers
摘要
循环Transformer对每个词元重复应用同一组层,以增加计算改善质量而不增参数。但每次递归都写自己的KV缓存,记忆仍随计算增长;推理期压缩缓存技术则以质量为代价。我们预训练共享记忆的循环语言模型:只有第一次递归写缓存,后续递归读取它并保留一个短的自有窗口。出人意料的是,共享记忆不仅不损失质量反而提升质量。在150M-1B参数下,我们的循环预测Transformer(LPT)及其混合变体为循环模型确立了新的质量-记忆前沿:五次递归下,混合变体在FineWeb-Edu上验证困惑度较同规模标准Transformer降低1.12-1.82,同时上下文记忆减少76-79%。通过大量分析我们探究共享记忆为何有效:共享与本地记忆发展出不同表示,后续递归主要关注共享记忆,后者还充当通向第一次递归的梯度高速通道。