论文
通过扰动实现语言模型外推
Perturbation is All You Need for Extrapolating Language Models
摘要
论文将大语言模型重新解释为前后加性噪声模型,建立其外推的统计理论。不同于基于精确前缀的标准自回归下一词元预测,所提流程先将前缀变换为语义邻近版本,再基于扰动后的前缀预测下一词元,从而形成具有前后加性噪声结构的层次模型。在这一框架中,研究通过证明自适应性、收缩性、稳健性、外推性和双重稳健性五项性质,建立严格的外推能力理论,即模型对训练语料经验支持范围之外的词元序列进行可靠预测的能力。论文使用合成与真实语言数据评估有限样本表现。结果显示,方法持续改善支持范围之外的预测,同时保持范围内的竞争性表现,为语言建模提供了一条基于扰动的可行路径。