论文
TimeSage-MT:评估代理时间序列推理的多轮基准
TimeSage-MT: A Multi-Turn Benchmark for Evaluating Agentic Time Series Reasoning
摘要
时间序列数据为许多现实世界领域的关键决策提供信息。虽然 大语言模型 (LLM) 代理可以通过自然语言和工具分析数据,但仍不清楚它们是否可以跨多轮对话进行可靠的时间序列分析。现有的基准侧重于预测和异常检测等单步任务,忽略了用户目标不断变化的实际工作流程,代理必须基于先前的分析,并从积累的证据中得出结论。在这项工作中,我们介绍了 TimeSage-MT,这是一个用于代理时间序列推理的多回合基准,具有跨 8 个现实世界领域的 240 个任务和 2,680 个对话回合,涵盖基本探索到面向决策的分析。 TimeSage-MT 是通过可重复的管道构建的,该管道将现实世界的时间序列数据转换为具有可验证答案的多轮对话。它提供了统一的评估协议和公共排行榜,用于比较时间序列代理系统。为了展示该基准的实用性,我们将前沿 LLM 与 TimeSage 一起进行评估,TimeSage 是一种配备了综合时间序列技能库的新型结构化代理。结果显示,由于内存故障、不确定性处理和基于领域的决策,决策导向型任务的性能急剧下降。 TimeSage-MT 揭示了当前代理推理中的关键差距,并为未来的发展提供了坚实的基础。