论文
真值 时间序列基础模型的强化学习 后训练 邻域正则化
Ground-Truth Neighborhood Regularization for Reinforcement Learning Post-Training of Time Series Foundation Models
摘要
时间序列预测(TSF)在广泛的现实应用中发挥着重要作用。最近,在大规模数据集上进行预训练的时间序列基础模型(TSFM)表现出强大的泛化能力,并成为 TSF 的重要范例。因此,强化学习(RL)后训练 作为进一步提高下游任务性能的一种手段,引起了越来越多的关注。然而,我们发现,在某些预测区域,RL 后训练 可能会逐渐使 TSFM 的输出分布偏离 真值,从而限制其性能。我们将这种现象称为 \textbf{次优崩溃}。我们的分析表明,在 真值 附近最初采样高质量轨迹的困难是导致次优崩溃的一个重要因素。为了解决这个问题,我们提出了 TSFM 的 RL 后训练 的 真值 邻域正则化(GTN-R)。 GTN-R使用真值作为定位高质量区域的参考,并将模型的概率质量引导至真值邻域。这增加了对高质量轨迹进行采样的概率,减少了次优崩溃,并提高了性能。此外,GTN-R 可以灵活地集成到 TSFM 的各种 RL 方法中。大量的实验证明了其有效性。