论文

TimeVista:探索并利用视觉语言模型作为时间序列预测裁判

TimeVista: Exploring and Exploiting Vision-Language Models as Judges for Time Series Forecasting

模型评测评测方法与指标

摘要

高质量时间序列预测对真实世界决策至关重要。但传统逐点指标常无法揭示复杂时间模式——且与人类直觉偏好对齐差。虽然"LLM即裁判"范式以灵活、人类对齐的判断革新了文本评估——其在时间序列上的应用仍大体未被探索。本文中——我们利用视觉语言模型(VLM)作为时间序列预测裁判——利用其理解以文本信息为根据的时间序列图的能力。具体地——我们提出新框架——整合由上下文信息支撑的微观与宏观判断来评估时间序列预测。为此——我们介绍TimeVista——含5,563个时间序列样本、配详细评估量规的综合VLM即裁判基准。大量元评估表明VLM是高度可靠的裁判——与人类偏好的一致性显著高于常规指标。基于我们的基准——我们在VLM即裁判范式下全面评估近期时间序列基础模型(TSFM)。结果表明VLM可作鲁棒且可解释的裁判——为评估时间序列模型提供全面、人类对齐的标准。

TimeVista:探索并利用视觉语言模型作为时间序列预测裁判:论文配图
图 1:传统的逐点指标无法反映现实场景中特定领域的偏好。