论文
语言模型推理的选择性状态空间适应和检索
Selective State-Space Adaptation and Retrieval for Language Model Reasoning
摘要
低秩自适应引入了静态学习更新,该更新同样应用于每个输入。该更新提供任务级适应,但未明确表示 词元级 或实例级状态变化。提出了一系列适配器,在两个互补的粒度上引入选择性状态空间控制。在 词元级 中,MaLoRA(Mamba 调制的低秩自适应)使适配器的缩放因子成为动态输入相关函数,具有跨词元的循环状态,这与之前工作的无状态调制器形成鲜明对比。 词元级 适配器对低秩适配进行了改进。另一方面,它通过结构角色而不是上下文相关性来区分标记,这促使将证据选择放在上下文级别。在上下文级别,MaRA(Mamba 检索适配器)跟踪跨段推理状态并选择与查询最相关的段。在支持段落召回方面,约 300 万个参数的状态空间控制检索超过了 80 亿个参数密集 检索器。尽管基础模型在没有适应的情况下在任务上表现不佳(14 至 25 F1),但 MaRA 恢复了其表示中潜在的证据相关性。在三个冻结骨干网和两个多跳推理基准测试中,端到端系列提高了 3×2 网格每个单元的推理准确性,与 LoRA 基线相比平均提高了 +6.4 F1(相对 +10.0%)。