论文
TimeSeriesExamAgent:大规模创建时间序列推理基准
TimeSeriesExamAgent: Creating Time Series Reasoning Benchmarks at Scale
摘要
大语言模型(LLM)在时间序列建模任务中表现出可喜的性能,但它们真正理解时间序列数据吗?尽管已有多个基准被提出以回答这一根本问题,但大多数依赖人工整理,且只关注狭窄领域或特定技能集。为解决这一局限,我们提出可扩展的方法来创建全面的时间序列推理基准,将模板的灵活性与LLM智能体的创造力相结合。我们首先开发了TimeSeriesExam,一个使用合成时间序列的多选题基准,在五个核心推理类别上评估LLM:模式识别、噪声理解、相似性分析、异常检测和因果性。然后,借助TimeSeriesExamAgent,我们通过从覆盖医疗、金融和天气领域的真实数据集自动生成基准来扩展该方法。通过多维度的质量评估,我们证明自动生成的基准实现了与人工整理基准相当的多样性。然而,我们的实验揭示,LLM在抽象时间序列推理和领域特定应用中的表现仍然有限,凸显了在这些模型中实现有效时间序列理解的持续挑战。TimeSeriesExamAgent已在 https://github.com/magwiazda/TimeSeriesExamAgent 开源。
