论文

语言模型的更好起点:领域条件位置偏移

A Better Start for Language Models: Domain-Conditional Position Offsets

模型训练参数高效训练

摘要

自回归语言模型在序列开始时最不准确,因为很少有上下文迫使人们依赖通用的预训练先验。我们表明,这种冷启动惩罚是与域相关的,并通过域条件位置偏移来减少它:将单个学习向量添加到第一个序列位置的嵌入激活,同时所有模型权重保持冻结。偏移在几分钟内训练大约一百个文档,在域之间切换,无需添加序列状态,并且没有可测量的延迟开销。在涵盖 410M 到 8B 参数的 8 个 Mamba、GPT-NeoX 和 Llama 模型中,它可将域内的困惑度降低高达 27%;效果持续到 70B,并且一个位置获得了大部分好处。匹配的、收敛的直接 logits 偏差校正最多仅达到 7.9%,并且后期词元损失保持不变,这表明偏移量通过模型状态传播,而不仅仅是重新校准先前的输出。经过调整的 LoRA 可以达到较低的复杂度,但使用多两到三个数量级的参数和主动的低秩权重路径,而软提示会添加序列位置。通过错误的域控制,当决策依赖于早期域内标记时,偏移量可以改善检索重排序和域分类。对于信号出现较晚的小样本推理,结果保持不变。位置感知预填充应用程序还有助于生成任务,而每个缓存解码步骤的天真的应用程序会导致重复。因此,偏移不是最强的适配器,而是用于短域内评分和校准的轻量级、热可切换工具。