论文
维度的祝福:高维空间中的近正交性如何解释时间可移植性
The Blessing of Dimensionality: How Near-Orthogonality in High-Dimensional Spaces Explains Temporal Portability
摘要
微调 已被广泛用于调整 大语言模型 (LLM) 来执行特定于域的任务。参数高效的 微调 (PEFT) 方法(例如低秩自适应 (LoRA))经常用于降低计算成本。 PortLLM是一种无需训练和无数据方案,用于在持续预训练后适应LLM。尽管最初的 PortLLM 结果表明 LoRA 补丁表现出短期时间可移植性,但 PortLLM 在连续预训练的多次更新中的长期性能仍未得到充分探索。此外,从理论角度来看,PortLLM 的令人着迷的有效性还没有得到很好的理解。我们通过以下方式解决这两个问题:(1) 使用基本模型 Mistral、Gemma 和 Qwen,对 PortLLM 补丁在 10 个连续预训练步骤中的长期时间可移植性进行广泛的实证研究; (2) 提供两种理论分析来解释我们的观察结果,即简单的 PortLLM 方法实现了有竞争力的性能。我们根据经验发现,可移植性在较长的时间内持续存在,这表明当基本模型定期更新时不需要重复的 微调。我们从理论上发现,高维向量的近正交性是时间可移植性的关键理由。我们的分析还展示了损失景观的几何视角,以促进不同适应方案的理论比较。