论文
ITGPT:不规则时间序列的生成预训练
ITGPT: Generative Pretraining on Irregular Timeseries
摘要
时间序列回归模型通常很难利用大量标记的多模态数据,特别是当数据不规则采样或包含缺失值时。这在医疗保健和预测性维护等领域很常见,这些领域的数据是从不可靠的来源收集的,并且标签需要专业知识或昂贵的设备。事实证明,基于 Transformer 的 大语言模型 通过自监督学习 (SSL) 和生成预训练 (GPT) 框架对文本等结构化数据有效。然而,此类模型缺乏有效处理不规则采样的多模态时间序列数据的灵活性。在本文中,我们介绍了 ITGPT,这是一种基于注意力的架构,旨在通过允许使用 SSL 损失和类似 GPT 的目标进行训练来处理多模式、不规则采样的时间序列。我们使用 TIHM 数据集评估其在医疗保健任务上的性能,并使用 CompX 数据集评估其在预测维护任务上的性能。我们的结果表明,ITGPT 无需重采样、特征融合或显式数据插补即可实现最先进的性能。此外,当标签稀缺时,ITGPT 通过 SSL 和 GPT 训练有效地利用未标记的数据,优于纯粹的监督方法。这代表了高效使用大型非结构化时间序列数据集进行实际推理任务的重要一步。