论文

基础模型何时能获得回报?预训练时间序列预测器的收支平衡分析

When Do Foundation Models Pay Off? A Break-Even Analysis of Pretrained Time Series Forecasters

模型评测模型能力评测

摘要

部署时间序列基础模型需要 GPU 基础设施和工程开销,并且不能保证比 XGBoost 有所改进。当这项投资获得回报时,我们将提供第一个系统的盈亏平衡分析答案。在 30 个基准数据集中,我们将零样本和 LoRA 微调基础模型(Chronos、Moirai、Lag-Llama)与经典基线(Naive、ETS、ARIMA、XGBoost)进行比较,六种训练集大小为可用数据的 2% 到 100%。在 30 个数据集中的 15 个数据集上,基础模型在每个评估的训练分数上都优于经典方法——无论数据量如何,GPU 部署在这些数据集上都是无条件合理的。在 6 个数据集上,经典方法仅用 2% 的训练数据(21-2,768 个样本)就超越了零样本基础模型;其余 9 个样本的盈亏平衡范围为 24 至 8,361 个样本。一项稳健的部署规则不需要 模型训练:如果 n_train < 700 并且季节性不可忽略,则使用 FM 零样本并跳过 微调 ——这会立即解决 30 个部署决策中的 10 个。与常见做法相反,LoRA 微调 会主动降低短系列的性能。我们将这些发现作为一个两步决策框架来实施——计算数据集长度和季节性强度,仅在需要时运行简短的 5-10% 试点——使从业者能够在投入完整基础设施之前做出 FM 与经典决策。尽管在这个基准规模上可靠的自动预测仍然是一个悬而未决的问题,但四个数据集特征激发了对其余情况的机械假设。代码、基准测试和决策工具可在 https://github.com/nicolaisi/fm-breakeven 获取。