论文
TSRBench:面向通用模型的多任务多模态时间序列推理综合基准
TSRBench: A Comprehensive Multi-task Multi-modal Time Series Reasoning Benchmark for Generalist Models
摘要
时间序列数据在现实场景中无处不在,对于从能源管理到交通控制等关键应用至关重要。因此,对时间序列进行推理的能力是通才模型解决实际问题的基本技能。然而,这个维度在现有的通才模型基准中明显缺失。为了弥补这一差距,我们引入了 TSRBench,这是一个综合性多模态基准测试,旨在对全谱时间序列推理能力进行压力测试。 TSRBench 的特点是:i) 来自 14 个领域的 4125 个不同问题,分为 4 个主要维度:感知、推理、预测和决策。 ii) 从 4 个维度评估基本推理能力(例如数字推理)的 15 项任务。通过大量实验,我们在 TSRBench 中评估了 30 多个领先的专有和开源 LLM、VLM 和 TSLLM。我们的研究结果表明:i)标度定律适用于感知和推理,但不适用于预测; ii)强推理并不能保证准确的上下文感知预测,这表明语义理解与数值预测之间的脱钩; iii)尽管作为输入的时间序列的文本和视觉表示具有互补性,但当前的多模态模型无法有效地融合它们以实现互惠的性能增益。 TSRBench 提供了一个标准化的评估平台,不仅突出了现有的挑战,还为推进通才模型提供了宝贵的见解。我们的代码和数据集可在 https://tsrbench.github.io/ 上获取。
