论文
学习扰动以改善大语言模型的分布外推
Learning Perturbations to Extrapolate Your LLM
摘要
大语言模型 的最新进展表明,注入扰动可以显着提高外推性能。然而,当前的方法通常依赖于固定设计的离散扰动,这限制了它们的灵活性。在这项工作中,我们提出了一个框架,其中标记前缀受到嵌入空间内连续潜在向量的可学习变换的干扰。为了克服棘手的边际似然的挑战,我们推导了模型参数的无偏估计方程,并通过随机梯度下降对其进行优化。我们在过度参数化的情况下建立了所得估计器的统计属性。对合成数据集和现实世界数据集的实证评估表明,我们的建议在域外设置中比一系列最先进的基线方法产生了显着的收益。