论文

TFRBench:用于评估预测系统的推理基准

TFRBench: A Reasoning Benchmark for Evaluating Forecasting Systems

模型评测基准与评测资源

摘要

我们提出TFRBench,首个旨在评估预测系统推理能力的基准。传统上,时间序列预测仅以数值准确率来评估,将基础模型视为“黑箱”。与现有基准不同,TFRBench提供了评估预测系统所生成推理的协议,特别是其对跨通道依赖、趋势和外部事件的分析。为此,我们提出一个系统化的多智能体框架,利用迭代验证循环来合成以数值为依据的推理轨迹。评估横跨五个领域的十个数据集,证实这种推理在因果上有效、可用于评估,并且用我们生成的轨迹来提示LLM,相比直接数值预测能显著提升预测准确率(例如平均 $\sim40.2\%\to56.6\%$),验证了我们推理的质量。反过来,基准实验显示,现成LLM在推理(LLM-as-a-Judge得分较低)和数值预测两方面都持续表现不佳,经常无法捕捉领域特定的动态。TFRBench由此为时间序列预测中可解释的、基于推理的评估确立了新标准。我们的基准发布于:https://tfrbench.github.io

TFRBench:用于评估预测系统的推理基准:论文配图
图 3: TFRBench 评估流程概述。虽然标准指标跟踪数值误差,但我们框架的核心重点是评估推理过程的质量。我们聘请LLM作为法官根据我们经过验证的“参考推理”审核候选人的推理轨迹。