论文
使用状态空间模型的长上下文演示选择
Long-Context Demonstration Selection Using State Space Models
摘要
我们研究演示选择的问题,其中涉及选择示例子集以前置到语言模型的查询。这个问题与上下文学习和语言模型推理密切相关。由于 Transformer 模型的推理成本与序列长度呈二次方关系,因此选择问题在长上下文场景中变得尤其具有挑战性。在本文中,我们通过建立状态空间模型(SSM)来解决这个问题,在给定输入的情况下,该模型只需要线性推理时间。我们的方法涉及两种算法。第一个通过(经过训练的)Transformer模型的蒸馏来学习一小组 SSM。我们将所有层划分为连续的组。然后,对于每个组,我们估计一个单独的状态空间模型来复制相邻层内的输入输出行为。其次,我们将经过提炼的模型输出映射到一小组词元,并将这些嵌入应用于下游应用程序中的演示选择。我们在合成数据集和真实数据集中进行了广泛的实验,以验证我们的方法。我们证明,经过蒸馏的 SSM 相对于真实输出仅产生小于 0.7\%$ 的近似误差。在下游评估中,我们表明,在几个文本分类和推理任务中,相对于基线演示选择方法,我们的方法将 FLOPs 减少了 14.2\times$,并将准确性提高了 6.48\%$。