论文

评估极端环境事件基础模型的普遍性:加州野火 PM2.5 案例研究

Evaluating the Generalizability of Foundation Models for Extreme Environmental Events: Case Study of California Wildfire PM2.5

模型评测模型能力评测

摘要

野火烟雾事件产生极端的 PM$_{2.5}$ 浓度,构成严重的公共卫生风险,但预测罕见的危险水平峰值仍然是一项根本挑战。时间序列基础模型 (TSFM) 是提供零样本推理和高效适应的预训练模型,在一般基准测试中表现强劲,但人们​​对它们在极端分布外条件下的行为知之甚少。我们提出了第一个系统基准测试,将六种 TSFM 配置(零样本 TimesFM、Chronos-2、Moirai-2 和 Time-MoE,加上 LoRA 微调的 Chronos-2 和 Time-MoE)与完全训练的基线(LSTM、BiLSTM、Transformer)和 12 年(2013--2025)每小时 PM$_{2.5}$ 数据集上的朴素持久性进行比较涵盖加州 79 个监测点的 1,375 起野火事件。留一事件 (LOIO) 协议使用 6、12 和 24 小时范围内 EPA AQI 阈值的 MAE、RMSE 和超标 F1 来评估对未见火灾的概括。结果显示出一致的层次结构。 BiLSTM 在每个阈值(包括危险带 ($>225.5\,μg/m^3$))上实现了最低的 MAE ($5.16\,μg/m^3$) 和最高的超出 F1,达到 0.63,而任何基础模型最多为 0.54。零样本 TSFM 在持久性方面仅略有改善,而零样本 Chronos-2 由于偶发的大错误而表现出严重的 RMSE 尾部不稳定($23.4\,μg/m^3$,负 $R^2$)。 LoRA 微调 极大地改善了适应性家族,并在很大程度上修复了这种不稳定性,但没有任何基础模型在任何指标上超过经过训练的循环基线。这些发现挑战了更大的预训练模型普遍主导环境预测并为野火空气质量预测提供可行的部署指导的假设。