论文
并行递归 LSTM
Parallel Recursive LSTM
摘要
Transformer 通过使用自注意力来实现富有表现力和高度并行的处理,已成为序列建模的主导架构。然而,由此产生的二次时间和内存成本限制了长上下文设置中的效率。 LSTM 等循环模型提供显式非线性状态更新和强大的状态跟踪功能,但其严格的顺序计算限制了并行性。我们引入了并行递归 LSTM (PR-LSTM),这是一种分层递归架构,它用平衡计算树上的递归非线性状态组合取代了从左到右的递归。词元首先独立映射到潜在状态,然后由学习的门控组合块递归合并。该结构使用并行扫描底层的缩减模式作为固定的执行调度,而不是假设关联循环。因此,PR-LSTM 保留了非线性门状态表示,同时将循环并行深度从线性减少到对数。根据经验,PR-LSTM 在形式语言基准上实现了强大的序列长度泛化,解决了比标准 RNN、LSTM 和 Transformer 基线更多的任务,同时避免了注意力的二次缩放。这些结果表明,可以分层重新组织循环计算以暴露并行性,而不将过渡动态限制为线性或关联形式。