论文
将历史压缩到内存中:将 Transformer 提取为循环 Transformer
Compressing History into Memory: Distilling Transformers into Recurrent Transformers
摘要
Transformer 是人工智能的主力,但在处理长序列时,它们的计算成本变得令人望而却步。我们的目标是长视距流视觉和机器人应用,在这些应用中存储和维护观察历史是特别不切实际的。循环 Transformer 通过维护固定大小的内存来解决此限制,但其性能落后于在整个观测历史记录中运行的 Transformer。我们认为,这种差距并非源于架构限制,而是源于这些模型学习压缩过去信息的方式的差异。如果无法访问观察历史,循环模型必须明确决定在每一步中将哪些内容保留在内存中,这是一个非常困难的学习问题。在这项工作中,我们提出了一种 蒸馏 方法,将经典全历史 Transformer 的压缩策略转移到循环变体。我们通过设计一个教师模型来实现这一点,该模型将其观察历史显式压缩为固定大小的瓶颈表示,并使用该瓶颈表示直接监督学生的记忆,从而有效地对齐两种压缩机制。我们证明,这种方法允许在 Mem-RPE 任务上训练具有线性时间复杂度的循环潜在机器人记忆,同时大大缩小与全历史 Transformer 的性能差距。我们还验证了流式视觉问答 (VQA) 的相同原理,并观察到由于内存 蒸馏 改进的循环预测