论文
Absorber LLM:利用因果同步进行测试时训练
Absorber LLM: Harnessing Causal Synchronization for Test-Time Training
摘要
Transformer 面临着较高的计算成本,该成本随着自注意力的序列长度而增长,从而导致长流中的推理因内存消耗而受到阻碍。 RNN 和 SSM 等恒定内存替代方案将历史压缩为固定大小的状态,从而丢失长尾依赖性,而将上下文记忆为参数的方法(例如测试时训练 (TTT))很容易过度拟合 词元级 投影,并且无法保留预训练 LLM 中上下文的因果效应。我们提出了 Absorber LLM,它将长上下文保留制定为自我监督的因果同步:将历史上下文吸收到参数中后,无上下文模型应该将原始模型与后代的完整上下文相匹配。我们通过将更新模型的内部行为与原始模型同步来优化这一目标,确保上下文吸收和泛化。长上下文和流基准测试表明,与之前的参数即内存基准相比,Absorber LLM 减少了推理内存并提高了准确性。