论文

迷失在非凸损失景观中:如何微调大型时间序列模型?

Lost in the Non-convex Loss Landscape: How to Fine-tune the Large Time Series Model?

模型训练监督微调与指令调优

摘要

最近,大型时间序列模型(LTSM)因其与 大语言模型 的相似性而受到越来越多的关注,包括灵活的上下文长度、可扩展性和任务通用性,优于先进的特定于任务的模型。然而,先前的研究表明,预训练的 LTSM 可能会表现出条件较差的非凸损失景观,从而导致可训练性有限。因此,直接的 微调 往往会导致过度拟合和次优性能,有时甚至比从头开始训练更糟糕,从而大大削弱了 预训练 的优势。为了克服这一限制,我们提出了 Smoothed Full 微调 (SFF),这是一种新颖的 微调 技术。具体来说,我们通过随机初始化构建辅助 LTSM 以获得更平滑的损失景观,然后将其权重与预训练模型的权重进行线性插值以平滑原始景观。此过程提高了可训练性,同时保留了预先训练的知识,从而使下游 微调 更加有效。从优化的角度来看,SFF 会扰乱尖锐的最小值,而不会显着损害平坦区域,从而有助于摆脱贫困的局部盆地,转向更平滑和更通用的解决方案。对基准数据集的大量实验表明,八个代表性 LTSM(包括 Timer、TimesFM、MOMENT、UnitTS、MOIRAI、Chronos、TTM 和 Sundial)在不同下游任务上取得了一致的改进。代码可从以下链接获取:https://github.com/Meteor-Stars/SFF。