论文
EMA 并不是您所需要的全部:在循环上下文中绘制结构和内容之间的界限
EMA Is Not All You Need: Mapping the Boundary Between Structure and Content in Recurrent Context
摘要
与简单的时间平均相比,高效的序列模型究竟能获得什么?我们使用指数移动平均(EMA)轨迹,最简单的循环上下文(无门控,无基于内容的检索)作为受控探针来映射固定系数累积可以表示和不能表示之间的边界。 EMA 轨迹对时间结构进行编码:具有多时间尺度轨迹的 Hebbian 架构在零标签的语法角色分配上实现了 96% 的监督 BiGRU,超越了结构依赖角色的监督模型。 EMA 痕迹破坏了 token 身份:仅使用 EMA 上下文的 130M 参数语言模型达到了 C4 困惑度 260 (8x GPT-2),并且预测器消融(用完整的 softmax 注意力替换线性预测器)产生相同的损失,将整个间隙定位到痕迹。痕迹应用有损、数据无关的压缩;由于数据处理不平等,下游预测器无法恢复丢弃的信息。固定系数积累,无论是跨时间还是跨深度,都会遭受不可逆的信息稀释,只有学习的、依赖于输入的选择才能解决这一问题。