论文
LoRA该去哪里?混合语言模型中的组件类型放置
Where Should LoRA Go? Component-Type Placement in Hybrid Language Models
摘要
将注意力与循环组件交错的混合语言模型与纯 Transformer 的竞争越来越激烈,但标准 LoRA 实践统一应用适配器,而不考虑每种组件类型的不同功能角色。我们系统地研究了两种混合架构中的组件型 LoRA 布局——Qwen3.5-0.8B(顺序,GatedDeltaNet + softmax 注意力)和 Falcon-H1-0.5B(并行,Mamba-2 SSM + 注意力)——在三个领域进行微调,并在五个基准上进行评估。我们发现注意力路径——尽管是少数组成部分——始终优于全模型适应,可训练参数减少了 5-10 倍。至关重要的是,调整循环主干在顺序混合中具有破坏性(GSM8K 上为-14.8 pp),但在并行混合中具有建设性(+8.6 pp)。我们进一步记录了迁移不对称性:并行混合体表现出积极的跨任务迁移,而顺序混合体则遭受灾难性遗忘。这些结果表明,混合拓扑从根本上决定了自适应响应,并且组件感知的 LoRA 布局是混合架构的必要设计维度。