论文
通过 Hankel 降阶建模的 SSM 适配器:注入位点确定长上下文中的任务适用性 微调
SSM Adapters via Hankel Reduced-order Modeling: Injection Site Determines Task Suitability in Long-Context Fine-Tuning
摘要
虽然参数高效的 微调 (PEFT) 通常针对注意力投射器,但其对于需要顺序状态积累的任务的功效仍未得到充分探索。我们检查用于此类任务的 PEFT 是否可以从状态空间模型 (SSM) 适配器中受益,以及 MLP 块是否是更好的注入位点。我们引入 Hankel 降阶模型 (HRM) 适配器,这是一种基于 SSM 的残差模块,通过经验 Hankel Grammians 的平衡截断进行初始化。通过利用系统矩阵 $\bar{A}$ 的时不变性,HRM 能够实现精确的基于 FFT 的并行扫描,从而在所有上下文长度上实现与 LoRA 的计算奇偶校验。在 Mistral-7B(8.4M 可训练参数)的等参数评估中,HRM 在 LongBench 任务上的表现优于 LoRA 变体,包括 QuALITY(+34.8\% 相对准确度)和 QMSum(+71.6\% 相对 ROUGE-1)。 HRM 进一步展示了在 18 种合成状态跟踪(DFA、Parity)和字符级语言建模(enwik8)配置中一致的优越性。门分析表明,HRM 适配器有效地学习调节循环,为长上下文序列建模的低秩适应提供了稳健的架构替代方案。