论文
SAGE:按变量注入语义知识的视觉语言时间序列预测
SAGE: Variate-Wise Semantic Augmentation for Vision-Language Time Series Forecasting
摘要
时间序列预测模型对原始数值序列进行操作,缺乏领域专家隐式利用的语义知识,例如每个变量的物理含义、其统计行为及其时间动态。最近弥补这一差距的努力分为两个阵营。有些在推理时依赖 大语言模型,这在计算上是昂贵的。其他人在数据集级别应用统一的文本提示,忽略各个变量之间的异构语义。我们提出了 SAGE(Seeing and Augmenting with Grounded Encoding),这是一种基于 CLIP 的端到端框架,可联合建模时间、跨变量、文本和视觉信息。 CLIP 文本编码器处理频率增强的序列片段和变量标记,而门控残差路径注入特定于变量的描述和统计描述符。同时,冻结的 CLIP 视觉编码器通过仅训练对比目标将渲染序列与时间表示对齐。 CLIP 的双重使用增加了互补的语义和视觉监督,而无需在预测循环中放置 LLM。在八个长期基准和 M4 中,SAGE 实现了最先进的准确性。消融证实了多模式对齐和变量级知识的互补收益。