论文
混合,不要挑选:为什么合成语料库组成对于时间序列基础模型预训练很重要
Mix, Don't Pick: Why Synthetic Corpus Composition Matters for Time Series Foundation Model Pretraining
摘要
为时间序列基础模型预训练选择错误的合成生成器代价高昂:在相同的训练预算下,最好和最差的生成器在预测误差上产生高达 2×$ 的差距,但该领域没有原则性的方法来做出这种选择。由于生成器排名在不同架构之间不稳定,问题变得更加复杂:在从头开始训练的 Chronos-T5-Mini 和 Moirai-Small 上评估的 11 个生成器系列中,我们发现哪些生成器有用取决于模型架构。我们没有解决生成器选择问题,而是回避它:所有生成器的简单等权重混合物匹配或击败两种架构的最佳单个生成器,并将这种混合物与真实数据组合在一起,产生整体上最强的预训练语料库。因此,综合预训练是一个语料库组成问题,而不是一个生成器选择问题,并且组成选择应该根据模型族进行验证,而不是假设要迁移。