论文

时间序列基础模型需要情境驱动压力测试

Time Series Forecasting Benchmarks Need Scenario-Grounded Stress Testing

模型评测评测方法与指标

摘要

时间序列预测(TSF)越来越多地驱动交通、能源、金融、医疗和基础设施决策,但当前评价过窄:标准基准奖励低留出误差,鲁棒性研究通常把失败归结为高斯噪声、随机掩码或有界对抗扰动,掩盖部署系统真实失效模式。输入异常并非只是噪声增大,常反映改变时序动力学、打破跨变量依赖、引发状态转移或从故障传感器传播到下游决策的结构事件。这些语义、因果和系统级失败不能仅用独立同分布扰动忠实表示。TSF基础模型兴起使问题更迫切,因为不可审计预训练语料削弱留出泛化的可信度。我们倡导情境驱动压力测试:每个实例包含历史输入与未来目标,以及语义情境、明确失败算子和可测难度。这样可使评价可解释、可归因、更贴近部署,让社区不只问哪个模型准确,还能问它何时失败、为何失败。