论文

TimeSage-EV:演化环境中Agentic时间序列分析的动态基准

TimeSage-EV: A Live Benchmark for Agentic Time Series Analysis in Evolving Environments

智能体系统Agent任务评测

摘要

高风险领域的时间序列分析依赖于周期性的数据发布,新观测可能改变证据基础以及后续结论的有效性。现有时间序列问答基准大多依赖固定快照,导致时间有效性和感知截止日期的证据使用未被评估。我们提出TimeSage-EV,一个面向演化环境中Agentic时间序列分析的动态基准。它跟踪6个领域中的60个真实机构场景,包含从2023年2月到2026年5月的1,485个场景-时期问答对,涵盖月度、周度、日度及不规则发布节奏。在每个时期,大语言模型(LLM)智能体会收到时间序列数据和来源报告,而被隐藏的目标发布数据作为真实标准。TimeSage-EV评估状态识别、数据汇总和展望推理。使用前沿LLM智能体以及TimeSage-1.0(一种带有可复用分析技能库的新型自进化智能体)的实验揭示了不同模型层级之间的显著性能差距,以及时间有效性、外生上下文使用和适应性方面的反复失败。我们将TimeSage-EV作为研究资源发布,附每月更新、代码、排行榜和失败模式分析。

TimeSage-EV:演化环境中Agentic时间序列分析的动态基准:论文配图
图1:TimeSage-EV 概览,支持智能体式时间序列任务与实时排行榜。TS:时间序列。