论文

LLM 预训练塑造了一个可推广的流形:深入了解跨模式转移到时间序列

LLM Pretraining Shapes a Generalizable Manifold: Insights into Cross-Modal Transfer to Time Series

模型评测模型行为与机制分析

摘要

经过语言预训练的 Transformer 能否成为有效的时间序列预测器,为什么?在本文中,我们表明跨模态迁移的出现是因为语言预训练以可重用流形进行时间序列训练为先决条件。冻结 LLM 状态上的线性探针无需配对监督即可解码真实的时间序列轨迹,并且在该投影空间中进行检索会产生有竞争力的预测,表明结构和动态在微调之前就存在。与随机初始化不同,预训练初始化还可以改进优化,产生相干梯度和高度各向异性的损失景观。然后,微调充当低维对齐,重用现有方向,而不是从头开始学习时间基元,低秩更新、子空间对齐以及周期性、趋势和重复的共享特征就证明了这一点。总之,这些结果支持 LLM 到时间序列转换的几何解释:语言预训练构建流形,微调将数值动态投影到任务相关方向。