论文

TimeSeriesExamAgent:大规模创建时间序列推理基准

TimeSeriesExamAgent: Creating Time Series Reasoning Benchmarks at Scale

模型评测基准与评测资源

摘要

大语言模型(LLM)在时间序列建模任务中表现出可喜的性能,但它们真正理解时间序列数据吗?尽管已有多个基准被提出以回答这一根本问题,但大多数依赖人工整理,且只关注狭窄领域或特定技能集。为解决这一局限,我们提出可扩展的方法来创建全面的时间序列推理基准,将模板的灵活性与LLM智能体的创造力相结合。我们首先开发了TimeSeriesExam,一个使用合成时间序列的多选题基准,在五个核心推理类别上评估LLM:模式识别、噪声理解、相似性分析、异常检测和因果性。然后,借助TimeSeriesExamAgent,我们通过从覆盖医疗、金融和天气领域的真实数据集自动生成基准来扩展该方法。通过多维度的质量评估,我们证明自动生成的基准实现了与人工整理基准相当的多样性。然而,我们的实验揭示,LLM在抽象时间序列推理和领域特定应用中的表现仍然有限,凸显了在这些模型中实现有效时间序列理解的持续挑战。TimeSeriesExamAgent已在 https://github.com/magwiazda/TimeSeriesExamAgent 开源。

TimeSeriesExamAgent:大规模创建时间序列推理基准:论文配图
图 1:(左)时间序列管理管道:合成模型逐步生成受控的合成时间序列。该管道通过组合不同的组件来创建大量具有不同属性的合成时间序列,从而实现多样性。 (右)每个模板评估一个特定类别,并包括一个问题、选项列表、用于上下文学习的示例问题和答案对,以及可选的复杂技术术语的提示和描述。在这里,GPT-4o 展示了其将视觉理解和时间序列概念转化为有效推理的能力。