论文

TemporalBench:评估基于LLM的代理在上下文与事件驱动时间序列任务上表现的基准

TemporalBench: A Benchmark for Evaluating LLM-Based Agents on Contextual and Event-Informed Time Series Tasks

模型评测基准与评测资源

摘要

强大的预测表现究竟反映真正的时间理解,还是在上下文与事件驱动条件下进行推理的能力,目前尚不清楚。我们提出 TemporalBench,一个多领域基准,旨在评估在信息逐步更丰富的设置下的时间推理行为。TemporalBench 采用四层任务分类法,在零售、医疗、能源和物理系统四个真实世界领域中考察历史结构解读、无上下文预测、上下文时间推理以及事件条件预测。通过控制对未来目标和上下文信息的访问,该基准能够对模型能否正确解读时间模式、将其与外部上下文对齐、并在条件变化时调整预测进行诊断性分析。大量基线实验表明,强大的数值预测准确率并不能可靠地转化为稳健的上下文或事件感知时间推理;相反,现有代理框架表现出碎片化的优势与系统性的失败模式,而这些在仅测预测的基准下大多被掩盖。TemporalBench 数据集已在 https://huggingface.co/datasets/Melady/TemporalBench 公开发布,我们还提供了一个公开排行榜:https://huggingface.co/spaces/Melady/TemporalBench_Leaderboard。

TemporalBench:评估基于LLM的代理在上下文与事件驱动时间序列任务上表现的基准
图1:我们基准中任务生成流水线的概览,展示了原始时间序列数据如何通过事件生成或检测、提示组装以及格式感知的任务构建被转化为 T1–T4 任务。