论文
通用测试时训练
Universal Test-Time Training
摘要
最近的测试时训练 (TTT) 架构将上下文压缩为快速权重,这些权重在线更新并作为记忆进行查询。现有的 TTT 设计使记忆对每一层都是私有的:它仅随着时间的推移而重复,并且深度仅索引 L 个单独的记忆。我们认为记忆所有权不必与深度绑定,并引入通用测试时训练 (uTTT),其中所有层都读写一个共享的记忆,同时保留特定于层的骨干模型参数。因此,共享的记忆在时间和深度两个维度上重复出现,以块和层为单位:一个块中深层的写入可以由下一个块中的浅层读取。我们将这个想法实例化为 uTTT-MoE 和 uTTT-Dense。 uTTT-MoE 将每个token头路由到所有层共享的池中的几个专家; uTTT-Dense 在每一层应用整个共享的记忆,无需路由。在语言建模中,uTTT-MoE 在 124M 和 760M 下达到 15.5 和 27.9 RULER 精度,比同等状态和主动计算下的层私有对应精度高出 2.6 和 2.1 个点,是经过测试的有界状态模型中最高的,每个token损失匹配或超过完全注意力。在新颖的视图合成中,以固定的每层计算共享在路由模型中的视图 23 对象 PSNR 中获得 0.92 dB,在密集模型中获得 0.76 dB。
