论文

并行流形转向:通过残余能量整形有效适应大型联想存储器

Parallel Manifold Steering: Efficient Adaptation of Large Associative Memories via Residual Energy Shaping

模型训练参数高效训练

摘要

大型 Transformer 模型充当密集关联记忆(DAM),通过自注意力机制 \citep{ramsauer2020hopfield, wu2024attention} 驱动的高维吸引子动力学来检索知识。然而,使这些冻结的记忆系统适应新任务会出现一个基本的“塑性-稳定性”困境。当前的方法要么通过直接修改突触权重(例如 LoRA)\citep{hu2021lora} 来冒灾难性干扰的风险,要么通过用静态提示标记(例如 VPT)\citep{jia2022vpt} 堵塞检索缓冲区来降低联想能力。在这项工作中,我们提出了 \textbf{H-Res} (分层剩余转向),这是一种调节 Transformer 的有效能量景观而不改变其全局平衡或扩展其序列长度的机制。通过将适应公式化为激活流形 \citep{chen2018neuralode} 上的控制问题,H-Res 学习了一个状态相关的向量场,该向量场将词元轨迹引导到特定于任务的吸引盆地。我们正式证明 H-Res 保留了基础模型的注意力熵并促进神经崩溃 \citep{papyan2020prevalence}。根据经验,Manifold Steering 在关联检索任务上的性能优于全局权重修改 26%,并消除了基于提示的方法的计算开销,有效地扩展到结构化域 \citep{zha2023vtab}。