论文
内存高效的循环 Transformer:在循环语言模型中将计算与内存解耦
Memory-Efficient Looped Transformer: Decoupling Compute from Memory in Looped Language Models
摘要
循环 LLM 架构已成为改进推理的一种有前景的方法,因为它们可以在嵌入空间中进行多步计算,而无需生成中间词元。 Ouro 等模型通过迭代更新内部表示来执行推理,同时在迭代中保留标准键值 (KV) 缓存,导致内存消耗随着推理深度线性增长。因此,增加推理迭代的数量可能会导致内存使用量过高,从而限制此类架构的实际可扩展性。在这项工作中,我们提出了 Memory-Efficient Looped Transformer (MELT),这是一种新颖的架构,可以将推理深度与内存消耗分离。 MELT 没有在每层和循环中使用标准 KV 缓存,而是在每层维护一个在推理循环之间共享的单个 KV 缓存。该缓存通过可学习的门控机制随时间更新。为了在该架构下实现稳定高效的训练,我们建议在两阶段过程中使用分块训练来训练 MELT:插值过渡,然后是注意对齐的 蒸馏,两者都是从 LoopLM 起始模型到 MELT。根据经验,我们表明,根据预训练的 Ouro 参数进行微调的 MELT 模型优于同等大小的标准 LLM,同时保持与这些模型相当的内存占用,并且比 Ouro 的小得多。总体而言,MELT 在不牺牲 LoopLM 性能的情况下实现了恒定内存迭代推理,仅使用轻量级 后训练 过程。