论文
TimeSage-EV:演化环境中Agentic时间序列分析的动态基准
TimeSage-EV: A Live Benchmark for Agentic Time Series Analysis in Evolving Environments
摘要
高风险领域的时间序列分析依赖于周期性的数据发布,新观测可能改变证据基础以及后续结论的有效性。现有时间序列问答基准大多依赖固定快照,导致时间有效性和感知截止日期的证据使用未被评估。我们提出TimeSage-EV,一个面向演化环境中Agentic时间序列分析的动态基准。它跟踪6个领域中的60个真实机构场景,包含从2023年2月到2026年5月的1,485个场景-时期问答对,涵盖月度、周度、日度及不规则发布节奏。在每个时期,大语言模型(LLM)智能体会收到时间序列数据和来源报告,而被隐藏的目标发布数据作为真实标准。TimeSage-EV评估状态识别、数据汇总和展望推理。使用前沿LLM智能体以及TimeSage-1.0(一种带有可复用分析技能库的新型自进化智能体)的实验揭示了不同模型层级之间的显著性能差距,以及时间有效性、外生上下文使用和适应性方面的反复失败。我们将TimeSage-EV作为研究资源发布,附每月更新、代码、排行榜和失败模式分析。
