论文

记忆注意力

Memory Attention

模型架构Transformer

摘要

语言模型通常从上下文隐藏状态构建注意力值,即使它们的某些内容可以跨上下文重用。我们研究在上下文信息的补充下,标记索引记忆是否可以取代专用值投影。我们提出了记忆注意力(MA),它通过将特定于层的标记记忆与上下文键相结合来形成值。内存提供特定于词元的表示,而键则保留上下文依赖性。在推理时,标准化可以折叠到内存表中,从而减少查找和加法的值构造。词元索引检索还可以通过预取来卸载 CPU,从而减少 GPU 参数存储。在匹配的训练词元预算和额外的内存参数下,跨注意力配置的实验显示出改进的语言建模和平均下游性能。